打開 ChatGPT 問一句「台灣有哪些 GEO 公司」,截圖、嘆氣、關掉——這件事我們自己做過,說白了,只測一次什麼都不是。AI 搜尋的答案每週都在變,單次快照只能告訴你「今天有沒有被提到」,不能告訴你「正在變好還是變壞」。這篇把 TOPCLASS 內部正在建的 GEO 情報系統整套攤開:怎麼建 30 到 50 句的問句庫、怎麼排程跑測、怎麼用 LLM 把每則回答拆成五個欄位、怎麼算出一個可以逐月追蹤的 Visibility Score、最後怎麼讓月報自己長出來。全程用 Google Sheets 加 API 就能跑,不用先掏錢買企業級工具。文末附上我們自己第一輪基準線的真實數字——不好看,照樣公開。
為什麼要有一套系統:一次手測是安慰劑,趨勢才是情報
先講殘酷的:你今天在 ChatGPT 看到自家品牌被推薦,換個瀏覽器、換一天再問,答案可能就不一樣。AI 搜尋的回答有隨機性,也會隨模型改版、索引更新而變動,所以單點測量的價值趨近於零。有價值的是同一組問句、固定頻率、連續測三個月之後畫出來的那條線。這條線量的東西,業界叫 AI 可見度,接下來整篇都在教你怎麼把它變成一個可追蹤的數字。
那要不要直接買現成工具?市面上有一整排方案,一張表看懂 build vs buy:
| 方案 | 價格 | 定位 | 繁中適用度 |
|---|---|---|---|
| 自建(本篇 SOP) | 幾乎免費,只有 API 用量費 | 完全客製、原始資料自己留 | 最高:問句、情緒、來源分類全用繁中定義 |
| Profound | 企業級(需詢價) | 大型品牌、多市場監測 | 英文優先 |
| Peec AI | 約 $89–499/月 | 中大型行銷團隊 | 英文優先 |
| Otterly.ai | 約 $29/月起 | 小團隊入門追蹤 | 英文優先 |
| HubSpot AI Search Grader | 免費 | 一次性快照健檢,非持續監測 | 英文優先 |
| Ahrefs Brand Radar | Ahrefs 套件內功能 | 已經付 Ahrefs 的團隊順手加開 | 英文優先 |
| Semrush AI Visibility Toolkit | Semrush 套件內功能 | 已經付 Semrush 的團隊順手加開 | 英文優先 |
重點在最後一欄。這些工具清一色英文優先:問句模板、情緒判斷、來源權重都是為英語市場設計的,繁中支援到什麼程度官方文件大多沒明講,下手前得自己驗證。預算夠的外商台灣分部可以買 Profound 再自己補繁中問句;但對多數台灣品牌,自建反而實際——成本低、問句貼近真實客群,而且你會被迫親眼讀過每一筆原始回答,這件事本身就是競爭情報。
第一步:建問句庫——六種問句 × 產品線,30 到 50 句就夠
問句庫是整套系統的地基,原則只有一條:測「客戶真的會問的句子」,不是測你希望被搜到的關鍵字。我們把問句分成六型:
- 是什麼型:「GEO 是什麼?」「AIEO 跟 SEO 差在哪?」——教育期的潛在客戶問的。
- 推薦型:「台灣有哪些做 GEO 的公司?」——商業價值最高,也是最該哭的那題。
- 比較型:「A 品牌跟 B 品牌哪個好?」——決策後期,輸了就是直接掉單。
- 怎麼選型:「怎麼挑 GEO 顧問?」「選 SEO 公司要注意什麼?」——AI 給的評估準則會反過來定義市場標準。
- 評價型:「某某公司評價如何?」「某某是詐騙嗎?」——聲譽防線。
- 價格型:「GEO 服務大概多少錢?」——AI 引用誰的報價區間,誰就掌握定錨權。
把六型跟你的產品線交叉成矩陣,每格挑 1 到 2 句。三條產品線的品牌大約 20 到 35 句,再加 5 到 10 句品牌自身題(描述、評價),總數落在 30 到 50 句。超過 50 句先砍——跑測、分類、人工抽驗的成本都會跟著爆,趨勢不需要那麼多樣本。
seed 從哪來:GSC 是現成的問句礦
別憑空想問句,先挖 Google Search Console 的真實查詢。拿我們自己當例子⟦2026-07 快照,近 90 天⟧:「geo軟體」157 次曝光但平均排名 58.9、「geo」113 次(59.9)、「geo公司」7 次(51.7)、「2026年最佳geo平台」9 次而且排名 8.0、「geo 是 什麼」12 次(57.3)。這五個查詢直接改寫就是現成問句:「有哪些 GEO 軟體?」「台灣有哪些 GEO 公司?」「2026 年最好的 GEO 平台是哪個?」——使用者已經用搜尋引擎投票告訴你他們想問什麼,你只是把同一句話拿去問 AI。另外兩個 seed 來源:客服信箱和業務被問到爛的問題(通常是價格型與比較型),以及 Google 搜尋結果頁的 People Also Ask 區塊。
第二步:排程跑測——哪些能自動、哪些只能手測
問句庫定了,接著決定怎麼跑。各平台的自動化可行性差很多,一張表看懂:
| 平台 | 自動化可行性 | 做法 | 注意 |
|---|---|---|---|
| ChatGPT | 半自動 | OpenAI API 程式化呼叫跑趨勢 | API 回答與網頁版搜尋結果不完全等價(官方沒有公開兩邊檢索管線的差異,以下是社群實測的推論:網頁版帶搜尋與記憶,API 預設不帶)。每月抽 5 句用網頁版手測校正 |
| Perplexity | 可全自動 | Sonar API | 回應自帶引用來源清單,是最適合程式化的一家 |
| Gemini | 可全自動 | Gemini API 開啟搜尋 grounding | 開了 grounding 才接近一般使用者看到的答案 |
| Google AI Overview | 半自動 | 第三方 SERP 抓取工具,或手動搜尋 | 沒有官方 API;出現與否還跟查詢字高度相關 |
| Copilot / 其他 | 手測為主 | 每月固定流程截圖 | 台灣流量占比低,先求有紀錄就好 |
登入態與免登入是另一個坑。免登入或無痕視窗測到的是「大眾版答案」;登入帳號的回答可能被個人化與歷史對話影響(官方沒有公開個人化的權重,以下是社群實測的推論:對品牌類問句影響通常不大,但無法排除)。所以基準線一律用免登入測,統一條件才有可比性。頻率抓每月完整一輪,遇到大型模型改版後加測一輪就好——不用每週跑,跑太密雜訊會淹掉趨勢,你會為了每一次隨機波動白緊張。
第三步:AI 分類抽取——把每則回答拆成五個欄位
一輪 40 句 × 4 個平台是 160 則回答,人工讀完會死。做法是把每則回答連同你的官方事實清單一起丟給 LLM,抽成五個固定欄位:有無提及、提及位置、情緒、引用了誰、描述對不對。欄位固定,後面的計分和報表才接得起來。
分類 prompt 全文(可直接複製)
你是品牌監測分析師。以下有一段「AI 搜尋平台的回答原文」、我要監測的品牌名稱、以及該品牌的官方事實清單。請只輸出一個 JSON 物件,不要任何多餘文字。欄位規則如下:
- mentioned:回答是否提及該品牌,填 true 或 false。
- position:若有提及,品牌是回答中第幾個被提到的品牌(整數,從 1 起算;若是唯一主角填 1);未提及填 null。
- sentiment:回答對該品牌的整體語氣,只能填 positive、neutral、negative 其中之一;未提及填 null。
- sources:回答引用的來源網域清單(字串陣列);沒有任何引用就填空陣列。
- accurate:對照官方事實清單,回答對品牌的描述是否正確,只能填 correct、partially_wrong、wrong;未提及填 null。若填了 partially_wrong 或 wrong,另加 errors 欄位,用陣列逐條寫出錯在哪裡。
品牌名稱:(填入)。官方事實清單:(填入 5 到 10 條,例如服務項目、成立年份、方法論版本、明確不提供的服務)。回答原文:(貼上整段回答)。
這裡有個坑:用 LLM 判 LLM 也會錯。sentiment 和 accurate 兩欄每月人工抽驗一成,被判成 negative 或 wrong 的全部人工複核——這些是你要拿去做決策的紅燈,錯不得。官方事實清單記得跟著公司改版更新,清單過期,accurate 欄位就整批失真。
第四步:Visibility Score——一條公式把 160 則回答變成一個數字
老闆不會看 160 列原始資料,他要一個數字。我們的公式:VS=各平台加總(平台權重 ×(提及分+位置分+引用分+情緒分))。子分數給分規則:
- 提及分:有提及 2 分,未提及 0 分。
- 位置分:前三名或開頭主角 2 分,中段 1 分,末段帶過 0.5 分,未提及 0 分。
- 引用分:AI 引用來源包含自家網域 2 分,只引用第三方但描述正確 1 分,無引用 0 分。
- 情緒分:正面 1 分,中性 0.5 分,負面 0 分。
單一平台單一問句滿分 7 分。平台權重是台灣情境下的主觀設定——官方沒有公開各平台繁中市場的準確市占,這組權重是我們依日常觀察的判斷,你可以照自己客群調整:
| 平台 | 權重 | 為什麼 |
|---|---|---|
| ChatGPT | 0.40 | 台灣一般使用者的第一入口,品牌問句量最大 |
| Google AI Overview | 0.25 | 直接疊在既有 Google 搜尋量上,觸及廣 |
| Gemini | 0.20 | Android 與 Google 生態系綁定,成長中 |
| Perplexity | 0.15 | 使用者少但引用透明,最適合當研究窗口 |
算一次給你看
以下為示範情境。假想品牌「好水堂」賣濾水器,測問句「2026 年推薦哪些濾水器品牌?」,四平台結果這樣計:
- ChatGPT(權重 0.40):被列在推薦清單第二位(提及 2+位置 2),引用一篇第三方開箱文且描述正確(引用 1),語氣正面(情緒 1)。小計 6,加權 0.40 × 6=2.40。
- Google AI Overview(0.25):整段沒出現品牌,小計 0,加權 0。
- Gemini(0.20):中段帶到一句(2+1),沒附任何引用(0),語氣中性(0.5)。小計 3.5,加權 0.70。
- Perplexity(0.15):末段才提到(2+0.5),但引用了好水堂官網(2),語氣正面(1)。小計 5.5,加權 0.825。
這題的 VS=2.40+0+0.70+0.825=3.93,除以滿分 7 換算百分制約 56 分。整個月報的總 VS 就是所有問句分數的平均。說白了,56 這個絕對值不重要,重要的是下個月是 61 還是 49,以及是哪一型問句、哪一個平台在拉低它。
第五步:進 Google Sheets 與 Looker Studio——月報自己長出來
分類抽出來的 JSON 直接寫進 Google Sheets,一則回答一列,欄位固定成這張模板:
| 欄位 | 範例 | 說明 |
|---|---|---|
| 日期 | 2026-07-05 | 跑測當天,同一輪用同一天 |
| 平台 | Perplexity | 固定選單,別手打出拼字變體 |
| 問句 ID | Q07 | 句子可微調,ID 不變,趨勢才接得起來 |
| 問句 | 台灣有哪些做 GEO 的公司? | 當輪實際送出的全文 |
| 提及 | 否 | mentioned 欄位 |
| 位置 | — | position,未提及留空 |
| 情緒 | — | sentiment |
| 引用來源 | geniushub、enterimc、nabi.104 | sources 陣列攤平,之後要彙總排行 |
| 分數 | 0 | 該平台該題的加權前小計 |
| 備註 | 名單 15 家皆未含本品牌 | 人工補充,抽驗時的判讀也記這裡 |
Looker Studio 接上這張 Sheet,三張圖就夠:VS 逐月趨勢線、平台別提及率長條圖、引用來源網域排行。月報從此不用「做」,打開連結就是最新的。GA4 那邊另外開一個探索報表,把 chatgpt.com、perplexity.ai、gemini.google.com 這些 referral 來源獨立成一組,跟 VS 放在同一頁對照——正常的順序是可見度先動、流量後動,中間會落後一到三個月。
第六步:數據變行動——分數不會自己長內容
系統的產出不是報表,是工單。三條轉換規則:
- 缺席的主題開內容工單。某一型問句連續兩輪全平台掛零,代表 AI 根本找不到能引用你的素材。開一篇正面回答該問句的完整文章:FAQ 結構、可被整段引用的自足段落、有出處的數字。下一輪就看這篇有沒有進 sources。
- 描述錯誤走修正迴路。accurate 標紅的,先看 sources 欄位查 AI 在讀哪一篇——多半是第三方舊文。聯繫得上就請對方更新;聯繫不上就在自家網站發布更新、更完整的版本把它壓過去。這條和品牌監測是同一套迴路,錯誤資訊放著不管,AI 會一直複誦。
- 引用來源清單變口碑佈局清單。把每輪 sources 彙總去重、按出現頻率排序,前幾名就是你這個產業的「AI 信任來源」。PR 稿、客座文章、名錄收錄,優先往那些網域放——與其猜 AI 信誰,不如直接看數據。
先拿自己開刀:TOPCLASS 的第一輪基準線全公開
說白了,這套系統我們先拿自己開刀。第一輪的數字不好看,照樣公開——基準線的意義本來就是讓之後每個月有東西可對照,而且誠實本身就是說服力。
推薦型問句先上。⟦2026-07-05 實測,免登入網頁版⟧問 Perplexity「台灣有哪些做 GEO 的公司?」:名單約 15 家,TOPCLASS 不在,提及 0、位置 0、引用 0,這題我們就是零分。整份名單和引用來源的逐家拆解在競品 AI 可見度比較;按上一段的規則三,那批第三方來源已經直接進了我們的口碑佈局清單。
品牌描述題更有意思。同日問「TOPCLASS 是什麼公司?」⟦2026-07-05 實測⟧:大方向正確,但 accurate 欄位抓到三個過時描述,來源幾乎全指向同一篇第三方舊文——三個錯分別錯在哪、後續怎麼修,完整記錄在AI 是怎麼介紹你的品牌。AI 對品牌的描述由第三方內容主導、而且會過時,我們自己就是活證據。
流量端也攤開。GA4 追蹤 2026-07-02 才裝上⟦2026-07 快照⟧,到 07-04 只累積 14 個 sessions、全部 direct,AI referral 掛零;GSC 近 90 天含「引用」二字的查詢 0 筆⟦2026-07 快照⟧。所以我們的 VS 起點就是:推薦題 0 分、品牌描述題三個欄位錯、AI 流量 0。這一輪只完整測了 Perplexity 免登入版,ChatGPT、Gemini、AI Overview 的基準線排下一輪補齊。之後每月跑一輪,數字連同修正動作一起公開對照——系統有沒有用,看我們自己的線就知道。
不想自己搭 Sheets、串 API?/audit 免費健檢就是這套系統的單次人工版——我們替你跑第一輪基準線,讓你先知道 AI 現在到底怎麼講你。
延伸閱讀:TOPCLASS GEO 工作流程:讓品牌被 ChatGPT、Gemini、Perplexity 推薦的 SOP | 競品 AI 可見度基準測試:量出你和對手在 AI 答案裡的差距 | GA4 AI 流量歸因:把 ChatGPT 帶來的訪客看清楚