跳到主要內容
GEO 主線 15 分鐘 2026-07-05

llms.txt 與 AI 爬蟲控制實作:robots 矩陣與 CDN 規則

llms.txt 與 AI 爬蟲控制完整實作:GPTBot、PerplexityBot、ClaudeBot 誰該擋誰該放?附 robots.txt 逐行範例、Cloudflare CDN 規則與 curl 驗證法,並逐區拆解 topclass.tw 真實 llms.txt。

AZ

Archie Zhu

TOPCLASS 創辦人 / SEO & GEO 顧問

每隔幾天就有客戶問我們:「要不要擋 AI 爬蟲?」這題沒有標準答案,但有標準的思考流程。這篇把三層工具講清楚——robots.txt 管君子協定、CDN 防火牆管真封鎖、llms.txt 管 AI 對你品牌的理解——然後給你一張主要 AI 爬蟲的分類表、一套照站型走的決策矩陣、可以直接抄的 robots 寫法,最後逐區拆解我們自己 topclass.tw/llms.txt 的真實檔案。看完你可以在 30 分鐘內把這三層全部設好,而且知道自己每一行為什麼這樣寫。

先分清楚三件事:llms.txt、robots.txt、CDN 防火牆各管什麼

說白了,這三個東西常被混在一起講,但它們的層級、強制力、對象完全不同。robots.txt 是放在網站根目錄的純文字檔,告訴爬蟲「哪裡可以抓、哪裡別抓」,但它只是請求,沒有任何技術強制力。CDN 防火牆(例如 Cloudflare 的 WAF)是真的把請求擋在門外,不管對方自稱是誰。llms.txt 則反過來——它不是擋人的,是給 AI 看的品牌說明書,主動餵給語言模型一份你希望它怎麼理解你的摘要。

llms.txt、robots.txt 與 CDN 防火牆三層 AI 爬蟲控制架構與主要爬蟲分類
三層控制架構:robots.txt 表態、CDN 執法、llms.txt 溝通——各管各的,缺一層就有洞。
層級位置管什麼強制力誰會理它
robots.txt網站根目錄 /robots.txt宣告哪些爬蟲可抓哪些路徑零,純自律協定守規矩的大廠爬蟲(Googlebot、GPTBot、ClaudeBot)
CDN 防火牆Cloudflare 等 CDN 層依 UA、IP、行為真正封鎖請求高,請求到不了主機所有流量,包含不報身分的爬蟲
llms.txt網站根目錄 /llms.txt給 AI 的品牌與內容導覽摘要無,且尚無官方標準部分 AI 工具與爬蟲,覆蓋率不明

記住一句話:robots.txt 是表態,CDN 是執法,llms.txt 是溝通。三層目的不同,不能互相取代。

一張表看懂主要 AI 爬蟲:訓練、檢索索引、即時代抓是三種完全不同的東西

擋不擋之前,先搞懂對面來的是誰。AI 爬蟲分三類,擋錯類別的代價差很多。「訓練類」抓你的內容回去養模型,跟你的即時流量無關;「檢索索引類」是 AI 搜尋引擎在建自己的索引,擋掉它等於從 AI 搜尋結果消失;「即時代抓類」是使用者當下問了問題,AI 替他去抓你的頁面——這種被擋掉,AI 就會當場說「無法讀取該網站」,然後引用你的競爭對手。

User-Agent所屬類型擋掉的後果
GPTBotOpenAI模型訓練內容不進未來 GPT 訓練資料;不直接影響 ChatGPT 搜尋引用
OAI-SearchBotOpenAI檢索索引從 ChatGPT Search 的索引消失,等於放棄被引用
ChatGPT-UserOpenAI即時代抓使用者請 ChatGPT 讀你的頁面時會失敗
PerplexityBotPerplexity檢索索引從 Perplexity 答案來源消失
Perplexity-UserPerplexity即時代抓使用者貼網址請它讀時失敗;官方文件自己寫明這類抓取不一定遵守 robots.txt
ClaudeBotAnthropic模型訓練為主內容不進 Claude 訓練資料
Google-ExtendedGoogleGemini 訓練開關只影響 Gemini 訓練與 grounding,不影響 Google 排名與 AI Overview
CCBotCommon Crawl公開資料集退出 Common Crawl,多數開源模型的訓練語料都從這來

這裡最容易踩雷的是把 GPTBot 跟 OAI-SearchBot 搞混。很多站長 2023 年跟風擋了 GPTBot,以為擋的是「AI 抄內容」,結果 2024 年 ChatGPT Search 上線後才發現自己順手把 OAI-SearchBot 也擋了,直接從 AI 搜尋蒸發。擋之前,一個 UA 一個 UA 看清楚。

第一步:決策矩陣——你的站該擋誰、放誰

我們的 GEO 立場很明確:只要你想被 AI 引用,檢索索引類與即時代抓類一律全放,沒有例外。要猶豫的只有訓練類。這張矩陣照站型走:

站型訓練類(GPTBot、ClaudeBot、CCBot)檢索索引類(OAI-SearchBot、PerplexityBot)即時代抓類(ChatGPT-User、Perplexity-User)
內容站、顧問站、B2B 官網放。被模型「記得」是長期資產全放全放
電商看情況。商品頁放無妨,會員價、庫存 API 路徑用 Disallow 圈出來全放,商品被 AI 推薦是新流量入口全放
媒體、原創內容授權方可擋,這是授權談判籌碼(紐時模式)想要導流就放,想逼授權就擋——這是商業決策不是技術決策建議放,擋了讀者體驗直接受害

TOPCLASS 自己是第一列:全放,含訓練類。理由很現實——我們拿 Perplexity 實測過「台灣有哪些做 GEO 的公司」這題,它點名了一排同業,就是沒有 TOPCLASS,完整名單和過程在競品 AI 可見度比較。連被 AI 看見都還沒做到的品牌,去擋 AI 爬蟲是本末倒置。

第二步:robots.txt 實作範例——逐行講清楚

以下是一份「想被引用、但圈出後台路徑」的標準寫法,逐行解釋:

robots.txt 內容這行在幹嘛
User-agent: GPTBot
Allow: /
明示放行 OpenAI 訓練爬蟲。不寫也是預設放行,但明示可以避免日後全域規則誤傷
User-agent: OAI-SearchBot
Allow: /
ChatGPT Search 的索引爬蟲,GEO 命脈,一定放
User-agent: PerplexityBot
Allow: /
Perplexity 索引,同上
User-agent: ClaudeBot
Allow: /
Anthropic 訓練爬蟲,我們選擇放
User-agent: *
Disallow: /api/
Disallow: /admin/
對所有爬蟲圈出 API 與後台路徑。注意:specific 的 UA 區塊會覆蓋星號區塊,所以上面那些 Allow 全站的爬蟲抓不抓 /api/ 要看它自己怎麼解讀,保險起見在各 UA 區塊也補上 Disallow
Sitemap: https://www.topclass.tw/sitemap-index.xml告訴所有爬蟲索引地圖在哪

特別澄清 Google-Extended,這是被誤解最多的一個。它不是獨立爬蟲,抓你網站的還是原本的 Googlebot;Google-Extended 只是一個用途開關,Disallow 它代表「我的內容不給 Gemini 訓練用」。它不影響 Google 搜尋排名,也不會把你從 AI Overview 拿掉——AI Overview 吃的是 Googlebot 建的一般搜尋索引。所以「擋 Google-Extended 保排名」跟「放 Google-Extended 換 AI Overview 曝光」都是錯的因果,這個開關純粹只管 Gemini 訓練這一件事。

第三步:llms.txt 撰寫 SOP——用我們自己的檔案拆給你看

llms.txt 的社群慣例格式很簡單:一個 H1 品牌名、一段引言式定位、幾個 H2 區塊。與其講抽象原則,直接拆 topclass.tw/llms.txt 每一區為什麼這樣寫:

品牌摘要區:一段話把定位釘死

檔案開頭是「# TOPCLASS」加一段以「大於符號」開頭的引言:台灣的 SEO 與 GEO 搜尋成長顧問、總部台北、兩項可各自單買的服務、10+ 年實戰、100% 白帽、不販賣保證排名式的承諾。這段是整份檔案最重要的 80 字。為什麼?我們問過 Perplexity「TOPCLASS 是什麼公司」,大方向對、細節錯了三處——連方法論都還在講舊版四階段——來源幾乎全指向同一篇 104 平台的舊介紹文,完整拆解在AI 是怎麼介紹你的品牌。這就是不寫 llms.txt 的代價——AI 對你品牌的理解,會被別人的過時文章主導。

Brand identity 與 Core services:給 AI 可核對的硬事實

創立 2014、創辦人 Archie Zhu、內湖區瑞光路的完整地址,這些寫進去是讓 AI 有一份跟官網 schema、Google 商家檔案一致的 NAP 資料可以交叉比對。服務區直接寫價格:SEO NT$100,000 起、GEO NT$150,000 起(含 SEO 基礎健檢)、全開方案 NT$300,000–500,000 跑 3–6 個月、免費健檢 2–3 個工作天回覆。很多同業不敢把價格寫進 llms.txt,我們的看法是:使用者本來就會問 AI「這家多少錢」,你不給答案,AI 就去猜或去抄第三方的舊數字。

Knowledge base、Methodology、Positioning notes:導覽加防錯

Knowledge base 區列出 71 篇教學、69 個名詞條目、RSS 與 Sitemap 位置,功能是導覽——告訴 AI 深度內容在哪。Methodology 區把五步驟完整寫出來(診斷現況與 AI 可見度、AI 問題地圖與關鍵字策略、可被引用的內容與結構、技術地基與口碑證據、追蹤與再優化),就是為了覆蓋掉上面實測抓到的舊版四階段。Positioning notes 是防錯區:明寫「不提供保證類承諾」「口碑不是獨立方案」,直接針對 AI 最常講錯的兩件事下修正。最後放 FAQ 三題和完整聯絡資訊(email、電話、地址、office hours 09:00–18:00),讓「怎麼聯絡 TOPCLASS」這種問題有官方答案可抄。

寫你自己的版本時照這個順序:先列出 AI 目前講錯你品牌的地方(去 Perplexity、ChatGPT 各問一次「某某是什麼公司」就知道),然後每一個錯誤對應一個修正區塊。llms.txt 不是行銷文案,是勘誤表。

第四步:CDN 層規則——robots.txt 防君子,防火牆防小人

robots.txt 寫得再漂亮,不理它的爬蟲照樣抓。Perplexity 官方文件自己承認使用者觸發的抓取可能不遵守 robots.txt,2024 年也有國外媒體實測報導過 Perplexity 用未申報的 UA 抓取被封鎖的頁面。所以真的要「擋」,只能在 CDN 層做。

用 Cloudflare 的話,實務上三個地方要看。第一,Security 底下的 Bots 設定有現成的 AI 爬蟲封鎖開關,一鍵擋掉已知的 AI Scrapers and Crawlers——注意 Cloudflare 從 2025 年中起對新加入的網域預設開啟這個封鎖,如果你的站是之後才上 Cloudflare、又想做 GEO,第一件事就是去把這個開關關掉,不然 robots.txt 寫 Allow 也沒用,請求根本到不了你主機。第二,要細緻控制就寫 WAF 自訂規則,用已驗證機器人類別搭配 UA 字串比對,做到「放 OAI-SearchBot、擋 CCBot」這種粒度。第三,Cloudflare 也在推爬蟲付費抓取的機制,媒體型網站可以關注,內容站暫時用不到。介面位置可能隨版本搬家,但這三層邏輯不會變。

這裡有個坑:CDN 規則和 robots.txt 打架時,輸的是你。我們看過客戶 robots.txt 全放、Cloudflare 卻開著 AI 封鎖,結果在 AI 搜尋整整隱形了半年還在納悶內容策略哪裡出錯。兩層要對表,缺一次稽核就可能白做工。

第五步:驗證——別上完規則就當作沒事

設定完不驗證,等於沒設。驗證流程四步:

  1. 用 curl 帶 AI 爬蟲的 UA 打自己的網站,例如 curl -I -A "GPTBot" https://www.topclass.tw/,看回應是 200 還是被 CDN 攔下的 403。把上面表格的每個 UA 都跑一輪,一分鐘的事。
  2. 直接打 curl https://www.topclass.tw/robots.txt/llms.txt,確認兩個檔案都是 200 且內容是最新版——部署流程漏掉純文字檔是常見事故。
  3. 抽查 server log 或 CDN 分析:過去 7 天有沒有 GPTBot、OAI-SearchBot、PerplexityBot 的實際請求記錄?有記錄且回應 200,才算真的通了。UA 字串可以偽造,嚴謹一點要反查來源 IP 是否落在各家公布的官方網段。
  4. 在 Perplexity 免登入模式實際問一次你的品牌名,看它引用的來源有沒有開始出現你自己的網域。

log 這塊水很深——怎麼分辨真假 GPTBot、怎麼算各家爬蟲的抓取頻率、哪些頁面被 AI 抓最兇,我們另外寫了一篇 AI 爬蟲 log 分析實戰,放在文末延伸閱讀。

說白了:llms.txt 沒有官方標準,我們為什麼還是花這 30 分鐘

把醜話講在前面:llms.txt 到今天仍然只是社群提案,不是任何官方標準。OpenAI 沒承諾會讀,Google 的人甚至公開潑過冷水。所以任何跟你說「上了 llms.txt 流量會漲」的人,都在賣你他自己也沒驗證過的東西。

我們的數據一樣攤開講。自家 GSC 曝光才剛起來、排名還遠,GA4 追蹤剛裝上、AI referral 掛零——完整基準線數字收在自建 GEO 情報系統。這是起點,不是成績單。llms.txt 對這些數字有沒有直接貢獻?現階段無法歸因,誰跟你說可以歸因誰就是在編。

那為什麼還是做?三個很無聊但很實在的理由。成本只要 30 分鐘,一份純文字檔,零工程風險。它是品牌敘事的下限保護——前面那個 Perplexity 實測已經證明,你不提供官方版本,AI 就拿 104 平台的舊文章當你的官方版本,而且會一直錯下去。還有,這個生態每季都在變,OAI-SearchBot 是 2024 年才冒出來的,等哪天某家 AI 宣布正式支援 llms.txt,先寫好的人直接受益,沒寫的人再排隊。期望值為正、下檔風險為零的事,做就對了。

robots.txt 表態、CDN 執法、llms.txt 溝通——三層 30 分鐘設好,是想被 AI 引用的品牌最便宜的基礎工程;想把「被引用」做成系統,看我們的 GEO 服務 怎麼從爬蟲控制一路做到品牌被 AI 主動點名。

延伸閱讀:AI 爬蟲 log 分析實戰 | 技術 SEO 稽核清單 | ChatGPT Search 優化指南

GEO

想被 ChatGPT、Perplexity 主動推薦?

讓 TOPCLASS 替品牌建立 AI 搜尋可引用性與口碑信任。

預約諮詢