同一個問題,Google 回你十條藍色連結,ChatGPT 直接給一段答案。差別在哪?Google 排名的單位是「整個網頁」,AI 引用的單位是「一個段落」。你的文章寫得再完整,AI 抓走的永遠只是其中兩三段——而大多數網站的段落,根本不是為了被單獨抓走而寫的。這篇把我們在 topclass.tw 上實際操作的段落工程(content chunking)拆成五個步驟:怎麼讓每個 H2 區塊自成單位、怎麼寫 40–60 字的答案模組、怎麼用定義句和表格提高抽取率、最後怎麼自己測。不用買任何工具,今天下午就能開始改。
AI 不引用文章,引用段落:chunk 到底是什麼
先講結論:chunk 是檢索系統處理內容的最小單位,通常是幾百個 token 的一個文字塊。ChatGPT、Perplexity 這類產品回答問題時,不會把你整篇文章從頭讀到尾,而是先把網頁切塊、算語意相似度,只挑最相關的兩三塊塞進答案裡。你寫三千字,真正被 AI 「看到」的可能只有其中兩段。
這就是答案引擎優化(AEO)跟傳統 SEO 最根本的分歧點。傳統 SEO 優化的是整頁的排名訊號;AEO 和 GEO 優化的是「單一段落被抽出來還能不能用」。至於各平台實際怎麼切塊,官方沒有公開,以下是社群實測的推論:多數檢索管線沿著標題階層切,H2、H3 是天然的切割線;也有按固定 token 數硬切的做法,段落拖太長就會被腰斬,前半句和後半句進了不同的 chunk,兩邊都變得不完整。
不經營自己的可引用段落,會發生什麼事?我們自己試過:在 Perplexity 問「TOPCLASS 是什麼公司?」,答案幾乎全靠同一篇第三方舊文撐著,內容還停在我們早就改掉的舊定位(完整實測在AI 是怎麼介紹你的品牌)。說白了:你不寫出自己的可引用段落,AI 就去引用別人寫你的段落,而且會過時。
第一步:讓每個 H2 區塊自成一個完整單位
self-contained 的意思很具體:把這個 H2 區塊單獨複製下來,貼給一個完全沒讀過全文的人,他要能看懂九成。看不懂,這段就沒有被引用的資格——因為 AI 抽走它的時候,同樣拿不到前後文。
測試方法零成本。挑一段,丟給同事或家人,不給標題、不給上下文,問「這段在講什麼」。對方皺眉頭反問你「哪個它?」「什麼的第三步?」,你就知道問題在哪了。
這裡最容易踩雷的寫法有三種。第一種是承上式開頭:「除了上述方法之外」「承接前一節的討論」——這段被單獨抽走時,「上述」是空的。第二種是裸代名詞:整段都在講「它」「這個工具」「該方法」,主詞留在上一段回不來。第三種是依賴前文的定義:你在第二節定義了一個縮寫,第五節直接用,讀第五節 chunk 的 AI 並不知道那是什麼。修法都不難,把每個 H2 區塊當成一篇 200 字的獨立短文來寫,開頭交代主詞,結尾把話說完。
第二步:40–60 字答案模組——每個 H2 開頭第一段就是直答
做法一句話講完:每個 H2 底下的第一段,直接用 40 到 60 個中文字回答這個 H2 提出的問題。不鋪陳、不賣關子、不寫「這是個好問題」。為什麼是 40–60 字?夠短,AI 能整段搬走不用裁切;夠長,裝得下主詞、結論、加一個條件或數字。
改寫前 vs 改寫後:一張表看差距
以下為示範情境。假想一家賣手沖器材的電商「山丘咖啡」,部落格文章的兩個 H2 開頭段,改寫前後長這樣:
| H2 標題 | 改寫前(鋪陳式開頭) | 改寫後(40–60 字直答) |
|---|---|---|
| 手沖水溫幾度最好? | 說到手沖咖啡,水溫一直是咖啡愛好者爭論不休的話題。有人堅持高溫萃取的飽滿,也有人偏好低溫的柔和,其實這背後牽涉到很多變因…… | 淺焙豆建議 90–93 度,深焙豆 85–88 度。水溫越高萃取越快,深焙豆用高溫容易出苦味;不確定就從 88 度開始,每次調 1 度。 |
| 濾杯要選錐形還是波浪形? | 走進器材店,琳瑯滿目的濾杯常讓新手不知所措。每種濾杯都有擁護者,選擇之前,我們先來認識濾杯的歷史…… | 新手選波浪形濾杯,因為水流分布平均、容錯高;錐形濾杯風味層次更明顯,但注水手法會直接影響成品,適合已練過穩定注水的人。 |
注意改寫後那欄的共同點:主詞明確、有數字、有條件判斷(不確定就怎樣、新手選什麼)。這種段落被 AI 抽走後,單獨放在答案裡完全成立。改寫前那種開頭不是不能寫——它可以放在直答段的後面當展開,但不能佔住 H2 開頭這個黃金位置。
第三步:結構訊號——定義句、清單、表格是抽取器的最愛
直答先給:對機器抽取最友善的三種形式是定義句(X 是 Y)、有序清單、乾淨的表格。它們的共同點是結構本身就標好了語意邊界,AI 不用猜哪裡是答案的開始和結束。
定義句式尤其被低估。「llms.txt 是一個放在網站根目錄的純文字檔,用來告訴 AI 爬蟲哪些內容值得讀」——這種句子幾乎是為了被引用而生的。每次介紹一個名詞,第一句就用「X 是……」的句式把定義寫死,不要用「大家可能聽過 X」這種繞法。
| 內容形式 | AI 抽取容易度 | 適用場景 |
|---|---|---|
| 定義句(X 是 Y,用來 Z) | 高 | 名詞解釋、wiki 條目、FAQ 答案 |
| 40–60 字直答段 | 高 | 每個 H2 的開頭第一段 |
| 有序清單(步驟列點) | 高 | SOP、教學流程、排名清單 |
| 表格 | 中高 | 規格比較、價格、前後對照 |
| 問答式段落(FAQ) | 中高 | 長尾問題、語音搜尋情境 |
| 散文式長段落 | 低 | 品牌故事、案例敘事、觀點文 |
表格有個前提:HTML 要乾淨,thead、tbody 分清楚,不要拿表格排版面。散文式長段落抽取率低,但不代表不能寫——案例和觀點本來就該用敘事,只是別指望那些段落幫你拿引用,引用的工作交給直答段和表格。
第四步:段落長度工程——一段一件事
規則就三條:一段只講一件事;長度控制在 3–4 行,大約 80–120 個中文字;段落裡的代名詞全部改回主詞。做到這三條,段落被硬切腰斬的機率大幅下降,切出來的每一塊也都還能獨立成立。
「一段一件事」是裡面最難執行的。寫作的人腦子裡的邏輯是連貫的,很自然就把原因、做法、注意事項塞進同一段,結果一段 300 字講了三件事。檢索系統比對語意時,這種段落對哪個問題都「有點像、又不夠像」,相似度分數卡在中間,反而三個問題都輪不到它。拆開,每段各自對準一個問題,命中率才會上來。
代名詞這件事值得單獨講。中文寫作習慣用「它」「這個檔案」「該做法」避免重複,人類讀起來順,機器讀起來是災難。段落被抽走之後,「它」指誰?沒人知道。修法很機械:每段第一次提到主體時,用全名——「它」改回「llms.txt」,「這套方法」改回「40–60 字答案模組」。讀起來稍微囉嗦一點,換來的是每一段都能單獨存活。這筆交易划算。
第五步:抽取率自測 SOP——把段落貼給 ChatGPT 就知道
自測方法免費、十五分鐘跑完一輪:把你的段落單獨貼給 ChatGPT,問「這段在講什麼」。它答得準,這段就具備被引用的條件;答得含糊或答錯,這段在真實檢索裡也一樣會被跳過。
完整流程五步
- 挑 10 個段落,優先挑每頁 H2 開頭的直答段——那是最該被引用的位置。
- 每段開一個全新對話(避免上下文污染),只貼那一段,問:「這段在講什麼?請用一句話複述。」
- 複述準確(主詞對、結論對、數字對)記 1 分,含糊或錯誤記 0 分。
- 套公式:抽取率=AI 正確複述的段落數 ÷ 測試段落數。
- 低於七成,回頭用第一到第四步修,修完重測同一批段落。
以下為示範情境。山丘咖啡挑了 10 段自測,6 段複述準確,抽取率 60%。失敗的 4 段攤開看,共同病因就是前面講過的那幾個:兩段用「它」當主詞、一段用「承上所述」開頭、一段 280 字塞了水溫和研磨度兩件事。照第二步和第四步改完,重測拿到 9/10。整個過程一個下午,零預算。想升級成自動化監測再考慮工具:Otterly.ai 約 $29/月起、Peec AI 約 $89–499/月,HubSpot AI Search Grader 則是免費的入門健檢;Ahrefs Brand Radar 和 Semrush AI Visibility Toolkit 是各自套件內的功能,已經有訂閱的人可以直接開來用。手動 SOP 先跑起來,再決定要不要花這筆錢。
我們自己的起點長什麼樣
誠實講,我們自己也才剛站上起跑線。GA4 剛裝、AI referral 掛零,GSC 也還撈不到跟「引用」相關的查詢——完整基準線數據記在自建 GEO 情報系統。在 Perplexity 問台灣有哪些做 GEO 的公司,名單上目前也沒有我們,那場實測放在競品 AI 可見度比較。這篇文章裡的每一條 SOP,就是我們自己正在爬的樓梯。數字小就寫小,之後的變化會持續公開。
照做 checklist:出手前勾完這 10 條
改版前把這張清單印出來,一頁一頁勾:
- ☐ 每個 H2 區塊單獨貼給別人看,看得懂九成
- ☐ 每個 H2 開頭第一段是 40–60 字直答
- ☐ 直答段裡有主詞、有結論、有至少一個數字或條件
- ☐ 每個名詞第一次出現時用「X 是……」定義句
- ☐ 步驟類內容改成有序清單,一列一個動作
- ☐ 比較類內容改成表格,thead 和 tbody 結構乾淨
- ☐ 每段只講一件事,長度 3–4 行以內
- ☐ 段落裡沒有裸代名詞,「它」都改回全名
- ☐ 沒有「承上所述」「除了以上」這類依賴前文的開頭
- ☐ 抽了 10 段跑自測,抽取率達到七成以上
十條全勾,這頁的段落工程就算完工。之後每次發新文章,發布前跑一次,五分鐘的事。
分工說明:這篇只講段落工程
先把邊界劃清楚,免得你以為做完這篇就做完了 GEO。這篇處理的是「段落層」:怎麼切、怎麼寫直答、怎麼測抽取率。文章整體怎麼規劃——選題、標題怎麼下、FAQ 區塊怎麼配、schema 怎麼掛——那是另一個層次的工程,在 AEO 答案引擎優化完整指南裡有完整展開。而 AI 到底怎麼檢索、embedding 和向量比對背後的原理是什麼,看 RAG 檢索原理與內容寫作那篇。三篇的關係是:RAG 篇講原理,AEO 篇講整篇文章的佈局,這篇講段落這個最小單位。從哪篇開始都行,但動手改網站,從這篇的 checklist 開始最快。
段落改好一段,AI 就多一個能引用你的入口——想直接把整站內容改成可被引用的格式,交給 TOPCLASS 的 GEO 服務,從診斷到段落工程一次做完。
延伸閱讀:RAG 檢索原理與內容寫作 | AEO 是什麼?答案引擎優化完整指南 | 語意 SEO 完整指南:善用 NLP 與語意搜尋讓你的內容真正被讀懂