跳到主要內容
GEO 主線 11 分鐘 2026-07-05

段落才是被引用的單位:GEO 內容 chunking 工程與 40–60 字答案模組

GEO 內容 chunking 工程實戰:AI 引用的是段落不是文章。五步驟打造 self-contained 區塊與 40–60 字答案模組,附抽取率自測 SOP、改寫前後對照表與 10 條 checklist。

AZ

Archie Zhu

TOPCLASS 創辦人 / SEO & GEO 顧問

同一個問題,Google 回你十條藍色連結,ChatGPT 直接給一段答案。差別在哪?Google 排名的單位是「整個網頁」,AI 引用的單位是「一個段落」。你的文章寫得再完整,AI 抓走的永遠只是其中兩三段——而大多數網站的段落,根本不是為了被單獨抓走而寫的。這篇把我們在 topclass.tw 上實際操作的段落工程(content chunking)拆成五個步驟:怎麼讓每個 H2 區塊自成單位、怎麼寫 40–60 字的答案模組、怎麼用定義句和表格提高抽取率、最後怎麼自己測。不用買任何工具,今天下午就能開始改。

AI 不引用文章,引用段落:chunk 到底是什麼

先講結論:chunk 是檢索系統處理內容的最小單位,通常是幾百個 token 的一個文字塊。ChatGPT、Perplexity 這類產品回答問題時,不會把你整篇文章從頭讀到尾,而是先把網頁切塊、算語意相似度,只挑最相關的兩三塊塞進答案裡。你寫三千字,真正被 AI 「看到」的可能只有其中兩段。

GEO 內容 chunking 工程:AI 引用的是段落不是文章,五步驟打造可被抽取的答案模組
檢索系統先切塊再比對,段落才是被引用的單位——五步驟段落工程總覽。

這就是答案引擎優化(AEO)跟傳統 SEO 最根本的分歧點。傳統 SEO 優化的是整頁的排名訊號;AEO 和 GEO 優化的是「單一段落被抽出來還能不能用」。至於各平台實際怎麼切塊,官方沒有公開,以下是社群實測的推論:多數檢索管線沿著標題階層切,H2、H3 是天然的切割線;也有按固定 token 數硬切的做法,段落拖太長就會被腰斬,前半句和後半句進了不同的 chunk,兩邊都變得不完整。

不經營自己的可引用段落,會發生什麼事?我們自己試過:在 Perplexity 問「TOPCLASS 是什麼公司?」,答案幾乎全靠同一篇第三方舊文撐著,內容還停在我們早就改掉的舊定位(完整實測在AI 是怎麼介紹你的品牌)。說白了:你不寫出自己的可引用段落,AI 就去引用別人寫你的段落,而且會過時。

第一步:讓每個 H2 區塊自成一個完整單位

self-contained 的意思很具體:把這個 H2 區塊單獨複製下來,貼給一個完全沒讀過全文的人,他要能看懂九成。看不懂,這段就沒有被引用的資格——因為 AI 抽走它的時候,同樣拿不到前後文。

測試方法零成本。挑一段,丟給同事或家人,不給標題、不給上下文,問「這段在講什麼」。對方皺眉頭反問你「哪個它?」「什麼的第三步?」,你就知道問題在哪了。

這裡最容易踩雷的寫法有三種。第一種是承上式開頭:「除了上述方法之外」「承接前一節的討論」——這段被單獨抽走時,「上述」是空的。第二種是裸代名詞:整段都在講「它」「這個工具」「該方法」,主詞留在上一段回不來。第三種是依賴前文的定義:你在第二節定義了一個縮寫,第五節直接用,讀第五節 chunk 的 AI 並不知道那是什麼。修法都不難,把每個 H2 區塊當成一篇 200 字的獨立短文來寫,開頭交代主詞,結尾把話說完。

第二步:40–60 字答案模組——每個 H2 開頭第一段就是直答

做法一句話講完:每個 H2 底下的第一段,直接用 40 到 60 個中文字回答這個 H2 提出的問題。不鋪陳、不賣關子、不寫「這是個好問題」。為什麼是 40–60 字?夠短,AI 能整段搬走不用裁切;夠長,裝得下主詞、結論、加一個條件或數字。

改寫前 vs 改寫後:一張表看差距

以下為示範情境。假想一家賣手沖器材的電商「山丘咖啡」,部落格文章的兩個 H2 開頭段,改寫前後長這樣:

H2 標題改寫前(鋪陳式開頭)改寫後(40–60 字直答)
手沖水溫幾度最好?說到手沖咖啡,水溫一直是咖啡愛好者爭論不休的話題。有人堅持高溫萃取的飽滿,也有人偏好低溫的柔和,其實這背後牽涉到很多變因……淺焙豆建議 90–93 度,深焙豆 85–88 度。水溫越高萃取越快,深焙豆用高溫容易出苦味;不確定就從 88 度開始,每次調 1 度。
濾杯要選錐形還是波浪形?走進器材店,琳瑯滿目的濾杯常讓新手不知所措。每種濾杯都有擁護者,選擇之前,我們先來認識濾杯的歷史……新手選波浪形濾杯,因為水流分布平均、容錯高;錐形濾杯風味層次更明顯,但注水手法會直接影響成品,適合已練過穩定注水的人。

注意改寫後那欄的共同點:主詞明確、有數字、有條件判斷(不確定就怎樣、新手選什麼)。這種段落被 AI 抽走後,單獨放在答案裡完全成立。改寫前那種開頭不是不能寫——它可以放在直答段的後面當展開,但不能佔住 H2 開頭這個黃金位置。

第三步:結構訊號——定義句、清單、表格是抽取器的最愛

直答先給:對機器抽取最友善的三種形式是定義句(X 是 Y)、有序清單、乾淨的表格。它們的共同點是結構本身就標好了語意邊界,AI 不用猜哪裡是答案的開始和結束。

定義句式尤其被低估。「llms.txt 是一個放在網站根目錄的純文字檔,用來告訴 AI 爬蟲哪些內容值得讀」——這種句子幾乎是為了被引用而生的。每次介紹一個名詞,第一句就用「X 是……」的句式把定義寫死,不要用「大家可能聽過 X」這種繞法。

內容形式AI 抽取容易度適用場景
定義句(X 是 Y,用來 Z)名詞解釋、wiki 條目、FAQ 答案
40–60 字直答段每個 H2 的開頭第一段
有序清單(步驟列點)SOP、教學流程、排名清單
表格中高規格比較、價格、前後對照
問答式段落(FAQ)中高長尾問題、語音搜尋情境
散文式長段落品牌故事、案例敘事、觀點文

表格有個前提:HTML 要乾淨,thead、tbody 分清楚,不要拿表格排版面。散文式長段落抽取率低,但不代表不能寫——案例和觀點本來就該用敘事,只是別指望那些段落幫你拿引用,引用的工作交給直答段和表格。

第四步:段落長度工程——一段一件事

規則就三條:一段只講一件事;長度控制在 3–4 行,大約 80–120 個中文字;段落裡的代名詞全部改回主詞。做到這三條,段落被硬切腰斬的機率大幅下降,切出來的每一塊也都還能獨立成立。

「一段一件事」是裡面最難執行的。寫作的人腦子裡的邏輯是連貫的,很自然就把原因、做法、注意事項塞進同一段,結果一段 300 字講了三件事。檢索系統比對語意時,這種段落對哪個問題都「有點像、又不夠像」,相似度分數卡在中間,反而三個問題都輪不到它。拆開,每段各自對準一個問題,命中率才會上來。

代名詞這件事值得單獨講。中文寫作習慣用「它」「這個檔案」「該做法」避免重複,人類讀起來順,機器讀起來是災難。段落被抽走之後,「它」指誰?沒人知道。修法很機械:每段第一次提到主體時,用全名——「它」改回「llms.txt」,「這套方法」改回「40–60 字答案模組」。讀起來稍微囉嗦一點,換來的是每一段都能單獨存活。這筆交易划算。

第五步:抽取率自測 SOP——把段落貼給 ChatGPT 就知道

自測方法免費、十五分鐘跑完一輪:把你的段落單獨貼給 ChatGPT,問「這段在講什麼」。它答得準,這段就具備被引用的條件;答得含糊或答錯,這段在真實檢索裡也一樣會被跳過。

完整流程五步

  1. 挑 10 個段落,優先挑每頁 H2 開頭的直答段——那是最該被引用的位置。
  2. 每段開一個全新對話(避免上下文污染),只貼那一段,問:「這段在講什麼?請用一句話複述。」
  3. 複述準確(主詞對、結論對、數字對)記 1 分,含糊或錯誤記 0 分。
  4. 套公式:抽取率=AI 正確複述的段落數 ÷ 測試段落數。
  5. 低於七成,回頭用第一到第四步修,修完重測同一批段落。

以下為示範情境。山丘咖啡挑了 10 段自測,6 段複述準確,抽取率 60%。失敗的 4 段攤開看,共同病因就是前面講過的那幾個:兩段用「它」當主詞、一段用「承上所述」開頭、一段 280 字塞了水溫和研磨度兩件事。照第二步和第四步改完,重測拿到 9/10。整個過程一個下午,零預算。想升級成自動化監測再考慮工具:Otterly.ai 約 $29/月起、Peec AI 約 $89–499/月,HubSpot AI Search Grader 則是免費的入門健檢;Ahrefs Brand Radar 和 Semrush AI Visibility Toolkit 是各自套件內的功能,已經有訂閱的人可以直接開來用。手動 SOP 先跑起來,再決定要不要花這筆錢。

我們自己的起點長什麼樣

誠實講,我們自己也才剛站上起跑線。GA4 剛裝、AI referral 掛零,GSC 也還撈不到跟「引用」相關的查詢——完整基準線數據記在自建 GEO 情報系統。在 Perplexity 問台灣有哪些做 GEO 的公司,名單上目前也沒有我們,那場實測放在競品 AI 可見度比較。這篇文章裡的每一條 SOP,就是我們自己正在爬的樓梯。數字小就寫小,之後的變化會持續公開。

照做 checklist:出手前勾完這 10 條

改版前把這張清單印出來,一頁一頁勾:

  • ☐ 每個 H2 區塊單獨貼給別人看,看得懂九成
  • ☐ 每個 H2 開頭第一段是 40–60 字直答
  • ☐ 直答段裡有主詞、有結論、有至少一個數字或條件
  • ☐ 每個名詞第一次出現時用「X 是……」定義句
  • ☐ 步驟類內容改成有序清單,一列一個動作
  • ☐ 比較類內容改成表格,thead 和 tbody 結構乾淨
  • ☐ 每段只講一件事,長度 3–4 行以內
  • ☐ 段落裡沒有裸代名詞,「它」都改回全名
  • ☐ 沒有「承上所述」「除了以上」這類依賴前文的開頭
  • ☐ 抽了 10 段跑自測,抽取率達到七成以上

十條全勾,這頁的段落工程就算完工。之後每次發新文章,發布前跑一次,五分鐘的事。

分工說明:這篇只講段落工程

先把邊界劃清楚,免得你以為做完這篇就做完了 GEO。這篇處理的是「段落層」:怎麼切、怎麼寫直答、怎麼測抽取率。文章整體怎麼規劃——選題、標題怎麼下、FAQ 區塊怎麼配、schema 怎麼掛——那是另一個層次的工程,在 AEO 答案引擎優化完整指南裡有完整展開。而 AI 到底怎麼檢索、embedding 和向量比對背後的原理是什麼,看 RAG 檢索原理與內容寫作那篇。三篇的關係是:RAG 篇講原理,AEO 篇講整篇文章的佈局,這篇講段落這個最小單位。從哪篇開始都行,但動手改網站,從這篇的 checklist 開始最快。

段落改好一段,AI 就多一個能引用你的入口——想直接把整站內容改成可被引用的格式,交給 TOPCLASS 的 GEO 服務,從診斷到段落工程一次做完。

延伸閱讀:RAG 檢索原理與內容寫作 | AEO 是什麼?答案引擎優化完整指南 | 語意 SEO 完整指南:善用 NLP 與語意搜尋讓你的內容真正被讀懂

GEO

想被 ChatGPT、Perplexity 主動推薦?

讓 TOPCLASS 替品牌建立 AI 搜尋可引用性與口碑信任。

預約諮詢