跳到主要內容
GEO 主線 9 分鐘 2026-07-05

競品 AI 可見度比較怎麼做?同一組問句、五個指標的 benchmark pipeline

競品 AI 可見度比較怎麼做?用同一組問句、五個指標(提及率、首位率、引用域名數、描述準確度、情緒)跑 benchmark pipeline,含 SoV 公式、月度追蹤表模板,以及 TOPCLASS 自己在 Perplexity 的誠實實測。

AZ

Archie Zhu

TOPCLASS 創辦人 / SEO & GEO 顧問

量自己的 AI 可見度只做了一半。ChatGPT 或 Perplexity 回答「這個類目有哪些推薦」的時候,答案是一份名單,不是一個名額——你沒上榜,等於把客戶直接讓給榜上的那幾家。這篇給你一套完整的競品 benchmark pipeline:同一組問句、五個指標、五個步驟,跑完你會拿到一張能逐月追蹤的計分表。我們也會把 TOPCLASS 自己在 Perplexity 上「不在名單裡」的實測結果攤開來當教材,因為這正是我們自己在解的題。

一張表看懂:要比的五個指標

先講清楚比什麼,不然測完一堆截圖也整理不出結論。競品 AI 可見度比較的核心只有五個指標,全部圍繞一個問題:AI 在回答你的類目問句時,怎麼對待你、怎麼對待你的競品。其中「引用域名數」牽涉到 AI 引用 的機制——AI 答案下方那排來源連結,決定了它「相信誰說的話」。

競品 AI 可見度比較:同一組問句、五個指標的 benchmark pipeline
五個指標、五個步驟,跑出一份可逐月追蹤的競品 AI 可見度計分表。
指標定義怎麼算看什麼
提及率某品牌在全部問句的答案中被點名的比例被提及的問句數 ÷ 總問句數你在不在牌桌上
首位率被提及時,排在答案第一個的比例排第一的次數 ÷ 被提及次數AI 心中的類目老大是誰
引用域名數答案引用來源中,指向該品牌相關內容的不重複域名數數答案下方的來源連結誰的第三方背書最厚
描述準確度AI 對品牌的描述有幾成是對的、幾成過時或編造逐句核對官網現況,記錯誤數AI 講的是現在的你還是三年前的你
情緒描述語氣偏正面、中性還是帶保留人工標注三檔即可有沒有被貼上負面標籤

五個指標不用一次全上。第一輪先做提及率和首位率,這兩個十分鐘就能看出殘酷的現實;引用域名數留到第四步反查時一起做,效率最高。

第一步:選競品、圈問句集

競品選 3 到 5 家就好。說白了,超過 5 家你的表格會爆掉,而且每月重測的時間成本會讓你第二個月就放棄。建議的組合:兩家跟你搶同一批客戶的直接競品、一家市場聲量最大的老大、一家內容產出特別兇的(就算規模比你小)。最後那家是雷達——它如果在 AI 答案裡爬得快,代表內容策略在這個類目有效。

問句集不要重新發明。如果你已經照我們監測系統那篇建了自己的問句庫,直接沿用同一組,20 到 30 句,分三類:類目型(「台灣有哪些做某某的公司」)、比較型(「A 跟 B 哪家好」)、品牌型(「某某公司評價如何」)。共用問句庫有個實際好處:你的自我監測數據和競品 benchmark 數據可以直接疊在同一張表上,不用做兩套。

第二步:同輪同條件測試——這裡最容易踩雷

Benchmark 最大的坑是「不同條件測出來的數字硬比」。AI 答案本來就有隨機性,你週一測自己、週四測競品,結果差異可能來自模型當天的心情,不是可見度真的變了。守住三個紀律:

  1. 同一天、同一個時段,把全部問句對全部平台跑完一輪。20 句 × 3 個平台大概兩小時,排半天做完。
  2. 記下模型版本和日期。平台改版模型後數字會跳動,沒記版本你會誤判成自己的優化見效或失效。
  3. 統一用免登入狀態測。登入帳號有對話記憶和個人化,你平常查自己品牌查太多次,答案會被污染。個人化到底影響多大?官方沒有公開,以下是社群實測的推論:登入態下自家品牌的提及率普遍偏高,所以拿登入態的結果去跟老闆報告,等於自己騙自己。

工具能省掉手動的部分。Otterly.ai 約 $29/月起可以排程跑固定問句;Peec AI 約 $89–499/月做多品牌追蹤;HubSpot AI Search Grader 免費,適合先掃一次當起點;預算夠的企業可以看 Profound,或直接用手上 Ahrefs 的 Brand Radar、Semrush 的 AI Visibility Toolkit(兩者都是套件內功能)。但第一輪我建議手動,你需要親眼看過答案長什麼樣子,才知道工具報表在講什麼。

第三步:共現分析——AI 把誰跟誰放在一起講

提及率是「有沒有」,共現分析是「怎麼被講」。逐條看類目型問句的答案,記三件事:哪些品牌總是一起出現(AI 認定的同一級競爭組)、誰永遠排在第一個被點名(類目代表品牌)、每家被掛上什麼描述詞(「老牌」「主打電商」「價格較高」)。

做完你會拿到一張 AI 版的市場地圖,而且它常常跟你自己認知的競爭格局不一樣。你以為的頭號對手可能根本不在 AI 的名單裡,反而某家你沒放在眼裡的小公司每次都被第一個點名。這張地圖比任何簡報上的定位圖都誠實,因為它就是潛在客戶問 AI 時實際看到的東西。

我們自己的誠實 benchmark:TOPCLASS 不在名單上

直接拿我們自己當第三步的教材。⟦2026-07-05 實測,免登入網頁版⟧我們在 Perplexity 問「台灣有哪些做 GEO 的公司?」它點名了約 15 家:萬智匯 GeniusHub、Welly SEO、將能數位、91APP、awoo、零一行銷、確認鍵 Enter IMC、MTMG SEO、戰國策、Harris 先生、艾斯伊歐、geomkt.app 等。TOPCLASS 不在名單上。

把這個結果照方法拆開看。答案的 10 個引用來源集中在 geniushub、enterimc、nabi.104 這些第三方文章——上榜品牌的共同點不是誰的服務比較好,而是「有人寫過他們」,尤其是那種一次整理十幾家的清單文。AI 不會自己去比較每家公司,它只是轉述已經存在的整理文。

同一天測的品牌型問句「TOPCLASS 是什麼公司?」⟦2026-07-05 實測⟧也一樣:10 個來源幾乎全指向同一篇好幾年前的第三方舊文,描述混了三處過時資訊,逐條核對的過程寫在AI 是怎麼介紹你的品牌。AI 講的是舊文裡的你,不是現在的你——這點我們用自家品牌驗證過。

至於我們自己的 GSC 和 GA4 基準線數字有多小,完整攤在自建 GEO 情報系統那篇——數字很小我們照寫,這個系列存在的原因,就是把從零開始的路整個記錄下來。

第四步:引用來源反查,做出內容缺口清單

回頭看每個答案下方的引用來源,把 URL 全部列進表格,然後回答一個問題:這些文章裡,有你嗎?以我們自己為例,Perplexity 引用的那幾篇「台灣 GEO 公司整理」,沒有一篇提到 TOPCLASS——這就是最具體的內容缺口。

反查完把缺口分三類處理。第一類是可爭取的:對方是媒體或學習平台,可以投稿、受訪、或提供資料請對方更新(順便修掉過時描述)。第二類是可自建的:市面上的整理文品質普通,你可以自己寫一篇更完整、更誠實的類目比較,讓 AI 之後有更好的來源可抓。第三類直接放棄:競品官方部落格,你進不去,別浪費時間。這份清單就是你下一季的內容排程,比任何關鍵字工具吐出來的題目清單都精準,因為每一條都對應一個 AI 已經在引用的位置。

第五步:SoV 計分+月度追蹤表

最後把全部觀察壓縮成一個可以逐月比的數字。公式很簡單:SoV=品牌被提及次數 ÷ 全部品牌提及總次數。注意分母是「全部品牌的提及加總」,不是問句數——這樣算出來的是你在 AI 答案聲量池裡的占比,競品漲你就掉,零和的現實看得最清楚。

以下為示範情境:假設飲料包材類目有甲、乙、丙三家,用 20 句問句對 Perplexity 跑一輪。甲被提及 14 次、乙 9 次、丙 5 次,提及總數 28。算出來甲的 SoV 是 50%、乙 32.1%、丙 17.9%。再看首位率:甲被提及 14 次裡有 11 次排第一,首位率 78.6%——甲不只在牌桌上,還是 AI 心中的類目代表。丙的功課就很明確:先解決「有沒有被提及」,SoV 不到兩成之前談首位率沒有意義。

月份問句數平台/模型版本提及次數(甲/乙/丙)SoV(甲/乙/丙)首位率(甲)備註
2026-0720Perplexity 免登入14 / 9 / 550% / 32.1% / 17.9%78.6%基準線
2026-0820(同上,記當月版本)投稿 2 篇後首測
2026-0920(同上)季度檢討

模板的重點是「同一組問句、同一個條件、每月同一週跑」。數字本身沒有絕對意義,趨勢才有。跑滿三個月,你就能回答老闆那句「我們做這些內容到底有沒有用」——用競品的曲線當對照組,而不是憑感覺。

AI 可見度是零和的:你不在名單上,客戶就流向名單上的那幾家。想知道你的品牌現在在 AI 答案裡長什麼樣子、輸在哪個指標,預約一次免費健檢,我們用同一套 pipeline 幫你跑第一輪基準線。

延伸閱讀:競品 SEO 分析怎麼做 | AI 可見度監測系統:從問句庫到儀表板 | Perplexity 引用優化實戰

GEO

想被 ChatGPT、Perplexity 主動推薦?

讓 TOPCLASS 替品牌建立 AI 搜尋可引用性與口碑信任。

預約諮詢