SEO

    怎麼用一個下午手動做一次 AI 可見度審計(以及為什麼你的第一個數字一定是錯的)

    Dmytro2026年7月25日閱讀約 7 分鐘

    用一張表格、不花訂閱費,你可以在大約三個小時裡量出自己品牌在 AI 回答裡的可見度。跑一組固定的 20 條提示詞,每條記四樣東西,然後每個月在同一組上重複一遍。方法就這些,而它產出的數字你能在會上守得住,這一點已經勝過好幾個付費看板了。

    至少手動做一次的理由一點也不體面。在你自己把提示詞跑完之前,你根本不知道某個工具的分數到底在數什麼,只會對著一張毫無意義的圖點頭。

    關於你拿到的第一個數字,有個誠實的提醒。它會是錯的,而最後一節會解釋為什麼這沒關係。

    怎麼用一組固定提示詞在 ChatGPT、Perplexity 和 Google AI Mode 上做 AI 可見度審計

    什麼是 AI 可見度審計?

    AI 可見度審計衡量的是:當有人在你的品類裡問一個購買問題時,助手提到、推薦或引用你品牌的頻率。你挑出真實買家會敲進去的提示詞,在受控條件下跑一遍,然後把結果記成資料,而不是記成感覺。

    受控這兩個字扛著全部的重量。助手會做個性化,會讀你的聊天記錄,還會在兩次執行之間改主意,所以一份無視這三件事的審計,量的是你自己的賬號而不是你的市場,而且它會討好你,因為你的賬號已經讀了一年關於你公司的東西。

    已經有工具了,為什麼還要自己動手?

    因為一個你復現不了的分數不是證據,也因為這個賽道有個誠信問題,值得在你花錢之前先弄明白。

    我們動筆前不久,有人在 r/DigitalMarketing 上發了這麼一句:「我們的 AI 可見度報告感覺像編的。只有我這樣嗎?」不只他一個。Ivan Palii 做 SEO 軟體,因此沒有任何理由替這個品類說好話,他大約同期測了七個主流的 AI 可見度工具,報告說沒有一個能在單條提示詞的粒度上給出可見度走勢。如果一個工具說不出是哪條提示詞動了,那它那個頭條數字就是個情緒戒指。

    這個問題底下還壓著一個更深的。2026 年 7 月發在 arXiv 上的一篇生成式引擎最佳化批判性綜述回顧了 45 項研究,結論是沒有任何一項被評估的技術能跨平臺穩定地改善可發現性、後續流量或業務結果。這個領域僅有的一次受控實驗,也就是被 KDD 2024 收錄的普林斯頓 GEO 論文,發現最佳化「可以讓生成式引擎回答中的可見度提升最多 40%」,但效力因領域而異。

    把這兩件事放在一起讀,合理的順序是先測量、後購買。而這大致是大多數團隊實際路徑的反過來。買看板。被數字嚇到。再問這數字是什麼意思。這個順序我們見過不止一次,從旁邊看永遠都很好笑。

    要點: 你手動做這件事,不是因為手工有什麼美德。你做一次,是為了判斷某個工具的數字值不值每月 90 美元,而這個判斷從外面是做不了的。

    怎麼做這份審計:六個步驟

    第 1 步:按四種意圖寫 20 條提示詞

    二十條足夠看出規律,也少到你真的能做完。分成四份:

    • 品型別提示詞,裡面不提你:「給代理公司用的最好的專案管理軟體」
    • 對比型提示詞,點名兩個競品但不點你:「12 人團隊用 Asana 還是 Monday」
    • 推薦型提示詞,帶一個約束條件:「每月 50 美元以下、能做郵件序列的最便宜 CRM」
    • 異議型提示詞,也就是彆扭的那些:「單幹的創辦人值得用[你的品類]嗎」

    每一條提示詞裡都別放你的品牌名。問「Aiter 好不好用」告訴你的是助手怎麼轉述我們自己的網站,那是另一個問題,而且遠沒有「它會不會主動提起我們」有用。

    有一個例外,值得多花那一分鐘。把「[你的品牌]是什麼?」在每個助手上單跑一次,作為獨立檢查,不要放進你計分的那一組。你在那裡量的不是可見度,是在你的實體資料裡抓幻覺:創辦人寫錯、價格寫錯、國家寫錯、兩年前砍掉的功能還在。我們就是這麼發現了一段關於自己的過時描述,而它已經安安靜靜地誤導了別人好幾個月。

    下面這個生成器會幫你把整組寫出來。

    生成你的 20 條審計提示詞

    全部在你的瀏覽器裡執行。不儲存、不上傳。

    品類

    你的品牌沒出現。這一組最難拿下,也最值錢。

    • 適合小團隊的最好的 你的品類
    • 2026 年最好用的 你的品類 工具
    • 最好的 你的品類 軟體是哪個
    • 專家推薦哪個 你的品類
    • 真正值得花錢的 你的品類 工具

    對比

    競品被點名,你沒有。用來測模型會不會主動想到你。

    • 競品 A 和 競品 B 哪個更好
    • 競品 A 的替代品
    • 跟 競品 B 比,競品 A 值不值
    • 五個人的團隊該選 競品 B 還是 競品 A
    • 從 競品 A 換成更便宜的

    推薦

    帶條件的提問。這類最容易成單,因為對方已經決定要買了。

    • 真正能用的最便宜的 你的品類
    • 五人團隊每月 100 美元以內的 你的品類
    • 一天就能配好的 你的品類
    • 沒預算的時候最好的 你的品類
    • 不需要開發人員的 你的品類

    異議

    不好聽的那些。幾乎沒人會問,而答案最能說明問題。

    • 一個人創業值不值得上 你的品類
    • 我真的需要 你的品類 嗎
    • 你的品類 為什麼這麼貴
    • 你的品類 工具常見的問題
    • 你的品類 能不能手動做

    每條都退出登入、在無痕視窗裡跑一遍,然後記下你有沒有被點名、被推薦,或者被當成來源引用。三列,不是一列。

    第 2 步:退出登入,在全新會話裡跑每一條

    退出賬號。用無痕視窗。別讓助手看到你的歷史記錄,因為個性化會悄悄遞給你一個好看的結果,而你會信。

    把同樣這 20 條提示詞在你在乎的每個助手上跑一遍。大多數團隊挑三個:ChatGPT、Google AI Mode 和 Perplexity。賣給開發者就加上 Claude。賣給那種 IT 部門給所有人統一配了微軟的大公司,就加上 Copilot。

    別六個全上。每多一個助手,工作量就乘以二十條提示詞,還會給你的均值添噪音,而你要做的決定一個都不會因此改變。

    第 3 步:記四個獨立欄位,不是一個總分

    工具會把這些壓成一個數字,而它們壓扁掉的那些細節,恰恰就是告訴你下週該修什麼的細節。

    欄位含義為什麼值得單獨一欄
    被提到你的品牌出現在回答裡的任何地方最便宜拿到,訊號最弱
    被推薦你被當作建議選項呈現和銷售線索走勢對得上的那一個
    被引用你的域名作為帶連結的來源出現真正帶來流量的那一個
    還有誰出現回答裡的其他所有品牌整張表上最有用的一欄

    前三欄分開的是三種真正不同的病。一個品牌可以一直被引用卻從來不被推薦,那是內容問題。也可以被推薦卻從來不被引用,那意味著模型認識你,但一個人也沒往你這裡送。一個數字把兩者都藏了起來。

    第四欄幾乎所有人都跳過,而它才是回本的那一欄。r/SEO 上有位 SEO 說得比我們好:最後這欄告訴你競品為什麼被挑中,而答案通常是對比文章、目錄站和論壇貼文,而不是競品自己網站上的任何東西。你不只是在量自己。你還免費拿到了一張地圖,標著模型在你品類裡信任哪些第三方頁面,而擠進那些頁面,幾乎總是比在排名上超過它們容易。

    第 4 步:對著三個點名的競品算聲量份額

    每條提示詞都記下哪些競品出現了。然後算聲量份額:你的提及數除以這組裡所有品牌的提及總數。

    挑三個競品,把這份名單釘死。在不同月份之間換掉對比物件,是這世上偽造進展最容易的辦法,而且如果你是在向別人彙報,對方遲早會發現。

    第 5 步:把無聊的後設資料記下來

    日期、助手、能看到的話記下模型版本、國家,以及你當時是不是退出登入狀態。

    跳過這一步,下個月的對比就一文不值,因為你不會知道是數字動了還是條件動了。我們跳過過。它確實一文不值。

    第 6 步:每月在完全相同的提示片語上重複

    同樣的提示詞、同樣的順序、同樣的條件。換了這組,你就是開了一個新實驗,而不是把舊的接著做。

    每月一次對幾乎所有人都是對的節奏。每週基本上是在量噪音,每季度又慢到你已經忘了自己當初在測哪一次內容改動。

    手動審計之外,該配哪些免費工具?

    四個,都免費,而它們合起來覆蓋了你那組提示詞夠不著的另一半畫面。

    1. Search Console 的生成式 AI 報告。 來自 AI 概覽和 AI Mode 的展示次數,直接來自 Google。沒有點擊也沒有搜尋詞,所以在拿它寫報告之前,先讀一下它顯示什麼、又藏了什麼
    2. Bing Webmaster Tools。 就算必應一點流量都不給你,也去驗證一下站點。它的 AI Performance 面板會報告 grounding queries,也就是助手跑去找資料時給自己寫的那些短語。這是唯一有人公開的、免費的查詢級資料。
    3. GA4,按來源來路拆開。 從 chatgpt.com、perplexity.ai 之類過來的流量。對大多數站點來說,今天這個量看著很小,但它是這份清單裡唯一和收入連著的一欄。
    4. 你的伺服器日誌或 CDN 面板。 哪些 AI 爬蟲在抓什麼,以及有沒有東西在擋它們。

    第四條值得加個提醒,因為這正是很多 GEO 建議興奮過頭的地方。爬蟲訪問是真問題,值得查一次。但它很少是壞掉的那個。今年審過大約 17000 個小企業網站的一位 SEO 在 r/SEO 上總結道:訪問幾乎從來不是瓶頸,robots.txt 通常沒問題,GPTBot 通常也沒被擋。真正弄死這些站的是,頁面上沒有任何東西能被拎出來當答案。

    要點: 爬蟲訪問查一次,壞了就修,然後別再盯著它。把機器人日誌當成你的排查層,把提示詞審計當成你真正的 KPI。

    想被引用,是不是非得在 Reddit 上?

    比那些建議說的要少,而且現在有一份很大的資料把標準答案攪複雜了。

    Ahrefs 分析了 140 萬條 ChatGPT 提示詞,結果釋出於 2026 年 4 月。ChatGPT 引用了它檢索到的網址中的大約一半。有意思的是按來源型別拆開:從它自己搜尋索引里拉來的結果,被引用的比例是 88.46%,而 Reddit 是 1.93%,YouTube 是 0.51%,學術來源是 0.40%。

    也就是說,模型大量地讀這些地方,卻很少引用它們。在 Reddit 上被討論,確實可能塑造模型對你品類的看法。但作為一條通往真實引用的路徑,它遠比不上你自己那個把問題乾淨利落答完的頁面。

    有句話得直說:Ahrefs 自己就賣 AI 可見度產品,所以他們在這場比賽裡有馬。我們引用他們,是因為樣本極大、方法公開,不是因為他們中立。

    同一份研究裡還有兩個結論值得貼在顯示器上。網址 slug 用自然語言寫的頁面被引用的比例是 89.78%,沒這麼寫的是 81.11%。被引用頁面在標題和查詢之間的語義相似度也更高,0.602 對 0.484,後者是被檢索到之後又被略過的那些。

    這是個無聊得可愛的結論。寫一個和別人真正會問的問題對得上的標題。用一個能讀懂的網址。差不多就這些。

    怎麼知道一個變化是真的?

    多數情況下你不知道,而這是做工具生意的人不會主動講的部分。

    助手的輸出不是確定性的。同一條提示詞跑兩次,你可能拿到不同的品牌、不同的順序,而你這邊什麼都沒改。所以從 20 條裡被提 6 次變成被提 8 次,在幻燈片裡看著是 33% 的增長,同時又穩穩落在你同一個下午把同一組跑兩遍就能得到的波動區間裡。

    兩條規則能讓你保持誠實。

    1. 第一天把基線那組跑兩遍。 這兩次完全相同的執行之間拉開多大的口子,那就是你的噪音底。任何比這個口子小的月度變化都不是結果,不管它在彙報材料裡多好看。
    2. 在相信一個小變化之前,先把這組擴大。 二十條提示詞給你的解析度很粗。如果兩個百分點的位移真的會改變一個商業決定,你需要的是 50 條或 100 條提示詞,而不是一個更漂亮的看板。

    還有第三個選項,一分錢不用花:每條提示詞跑三次取平均,而不是只跑一次。跑一次是拋硬幣。跑三次才叫測量。它會讓你的下午變成三倍,所以我們只會對那幾條真正有商業分量的提示詞這麼做。

    老實說,這個領域裡被報出來的月度變化,大多數是穿了西裝的噪音。

    分數難看的時候到底該做什麼?

    先修你的 SEO,而且這是 Google 的建議,不是我們的。

    Google 面向生成式 AI 功能的最佳化指南直接自問現有的 SEO 做法是否仍然適用。它的答案是:「簡單說,是的。SEO 的最佳實踐依然有效,因為我們在 Google 搜尋上的生成式 AI 功能植根於我們核心的搜尋排名與品質系統。」它還往前走了一步,明說「為生成式 AI 搜尋做最佳化,就是為搜尋體驗做最佳化,因此依然是 SEO」。

    同一份指南列出了可以跳過的工作:llms.txt 檔案、內容分塊、專門給 AI 的改寫,以及去追那些不真實的提及。這是 Google 白紙黑字告訴你,四個流行的 GEO 手法是不必要的。它推薦的東西倒是既普通又難做:一個屬於自己的觀點、不是流水線貨的內容、滿足技術要求、像樣的頁面體驗、更少的重複內容。

    除此之外,你的審計會告訴你自己碰上的是三個問題裡的哪一個。

    被引用但從來不被推薦。 你的頁面在描述功能,而提示詞在問情境。這個差距通常靠改寫來彌合:寫買家正在完成的那件事,而不是你在賣的那樣東西,這一點我們在客戶異議與待辦任務理論那篇裡展開過。

    被推薦但從來不被引用。 模型認識你,卻一個人也不往你這裡送。通常的解釋是,對那個說法而言,你自己的頁面不是最乾淨的可用來源,於是它引用了別人對你的描述。

    兩樣都沒有,而競品到處都是。 回到第四欄。那些反覆出現的第三方頁面就是你的目標清單,而擠進一個對比頁或一個目錄站,通常比在排名上超過它快。

    關於 FAQ 板塊,順便說一句,因為所有人都會問。它們作為結構有用,作為花招沒用,而且 Google 已經對大多數網站取消了 FAQ 富媒體結果,所以摘要獎已經沒有了。真正有效的是寫出一個不靠上面那段也站得住的答案,因為檢索系統會把你的頁面切成若干片段,逐片打分。有位 SEO 把眼下這一波問句式 H2 叫作「上個時代的關鍵字堆砌」,我們覺得他說對了一半。格式本身沒問題。把它擰到什麼都沒回答的頁面上,才是會失敗的做法。

    這一切全靠手工做,大概到第十二條提示詞就不好玩了。把研究和一半的起草自動跑掉,差不多就是我們做 Aiter 的目的,不過第一次審計還是值得自己做,因為你正是在那裡學會這些數字到底意味著什麼。

    不管怎樣。現在就去問 ChatGPT 你的品類裡最好的工具是什麼,退出登入狀態,就現在。回來的東西就是你真實的基線,而弄清楚它大概要四十秒。

    常見問題(FAQ)

    一次 AI 可見度審計要多久?

    20 條提示詞乘以三個助手,大約三個小時,其中大部分是複製貼上。表格建好之後,第二個月大概一個小時。

    我需要多少條提示詞?

    二十條看形狀,50 條以上才能比較有信心地識別小變化。從 20 條開始,只有當一個真實決定取決於精度時才擴大。

    提示詞該登入跑還是退出登入跑?

    退出登入,用無痕視窗。登入狀態的結果反映的是你自己的歷史,會讓你的品牌出現得遠比在陌生人那裡頻繁。

    能用 ChatGPT 的 API 自動化嗎?

    能,但結果不會和消費級應用一致。網頁介面在原始模型之上疊了檢索、工具和系統提示詞。想要量就去自動化,但別把 API 的輸出當成買家看到的東西呈現。

    多少算是好的 AI 可見度分數?

    沒有任何值得引用的基準,因為聲量份額完全取決於你的品類有多擠。在固定提示片語上你自己的那條趨勢線,是唯一有意義的對比。

    被 AI 引用真的會帶來流量嗎?

    有時候會,而且比引用次數暗示的要少。讀到一段提及你的摘要的人,可能永遠不會點進來。把引用當作被收錄的證據,剩下的去 GA4 的來源資料裡查。

    有免費的 AI 可見度工具嗎?

    Search Console 和 Bing Webmaster Tools 都免費提供 AI 資料,兩者合起來覆蓋了 Google 和微軟的介面。至於其他所有助手,免費的選項就是你自己的時間和一張表格。

    這件事必須每月做嗎?

    每月一次適合大多數團隊。每週基本是在量噪音,每季度又太慢,沒法把一個效果和引起它的那次內容改動接上。