用一张表格、不花订阅费,你可以在大约三个小时里量出自己品牌在 AI 回答里的可见度。跑一组固定的 20 条提示词,每条记四样东西,然后每个月在同一组上重复一遍。方法就这些,而它产出的数字你能在会上守得住,这一点已经胜过好几个付费看板了。
至少手动做一次的理由一点也不体面。在你自己把提示词跑完之前,你根本不知道某个工具的分数到底在数什么,只会对着一张毫无意义的图点头。
关于你拿到的第一个数字,有个诚实的提醒。它会是错的,而最后一节会解释为什么这没关系。

什么是 AI 可见度审计?
AI 可见度审计衡量的是:当有人在你的品类里问一个购买问题时,助手提到、推荐或引用你品牌的频率。你挑出真实买家会敲进去的提示词,在受控条件下跑一遍,然后把结果记成数据,而不是记成感觉。
受控这两个字扛着全部的重量。助手会做个性化,会读你的聊天记录,还会在两次运行之间改主意,所以一份无视这三件事的审计,量的是你自己的账号而不是你的市场,而且它会讨好你,因为你的账号已经读了一年关于你公司的东西。
已经有工具了,为什么还要自己动手?
因为一个你复现不了的分数不是证据,也因为这个赛道有个诚信问题,值得在你花钱之前先弄明白。
我们动笔前不久,有人在 r/DigitalMarketing 上发了这么一句:“我们的 AI 可见度报告感觉像编的。只有我这样吗?”不只他一个。Ivan Palii 做 SEO 软件,因此没有任何理由替这个品类说好话,他大约同期测了七个主流的 AI 可见度工具,报告说没有一个能在单条提示词的粒度上给出可见度走势。如果一个工具说不出是哪条提示词动了,那它那个头条数字就是个情绪戒指。
这个问题底下还压着一个更深的。2026 年 7 月发在 arXiv 上的一篇生成式引擎优化批判性综述回顾了 45 项研究,结论是没有任何一项被评估的技术能跨平台稳定地改善可发现性、后续流量或业务结果。这个领域仅有的一次受控实验,也就是被 KDD 2024 收录的普林斯顿 GEO 论文,发现优化“可以让生成式引擎回答中的可见度提升最多 40%”,但效力因领域而异。
把这两件事放在一起读,合理的顺序是先测量、后购买。而这大致是大多数团队实际路径的反过来。买看板。被数字吓到。再问这数字是什么意思。这个顺序我们见过不止一次,从旁边看永远都很好笑。
要点: 你手动做这件事,不是因为手工有什么美德。你做一次,是为了判断某个工具的数字值不值每月 90 美元,而这个判断从外面是做不了的。
怎么做这份审计:六个步骤
第 1 步:按四种意图写 20 条提示词
二十条足够看出规律,也少到你真的能做完。分成四份:
- 品类型提示词,里面不提你:“给代理公司用的最好的项目管理软件”
- 对比型提示词,点名两个竞品但不点你:“12 人团队用 Asana 还是 Monday”
- 推荐型提示词,带一个约束条件:“每月 50 美元以下、能做邮件序列的最便宜 CRM”
- 异议型提示词,也就是别扭的那些:“单干的创始人值得用[你的品类]吗”
每一条提示词里都别放你的品牌名。问“Aiter 好不好用”告诉你的是助手怎么转述我们自己的网站,那是另一个问题,而且远没有“它会不会主动提起我们”有用。
有一个例外,值得多花那一分钟。把“[你的品牌]是什么?”在每个助手上单跑一次,作为独立检查,不要放进你计分的那一组。你在那里量的不是可见度,是在你的实体数据里抓幻觉:创始人写错、价格写错、国家写错、两年前砍掉的功能还在。我们就是这么发现了一段关于自己的过时描述,而它已经安安静静地误导了别人好几个月。
下面这个生成器会帮你把整组写出来。
生成你的 20 条审计提示词
全部在你的浏览器里运行。不保存、不上传。
品类
你的品牌没出现。这一组最难拿下,也最值钱。
适合小团队的最好的 你的品类2026 年最好用的 你的品类 工具最好的 你的品类 软件是哪个专家推荐哪个 你的品类真正值得花钱的 你的品类 工具
对比
竞品被点名,你没有。用来测模型会不会主动想到你。
竞品 A 和 竞品 B 哪个更好竞品 A 的替代品跟 竞品 B 比,竞品 A 值不值五个人的团队该选 竞品 B 还是 竞品 A从 竞品 A 换成更便宜的
推荐
带条件的提问。这类最容易成单,因为对方已经决定要买了。
真正能用的最便宜的 你的品类五人团队每月 100 美元以内的 你的品类一天就能配好的 你的品类没预算的时候最好的 你的品类不需要开发人员的 你的品类
异议
不好听的那些。几乎没人会问,而答案最能说明问题。
一个人创业值不值得上 你的品类我真的需要 你的品类 吗你的品类 为什么这么贵你的品类 工具常见的问题你的品类 能不能手动做
每条都退出登录、在无痕窗口里跑一遍,然后记下你有没有被点名、被推荐,或者被当成来源引用。三列,不是一列。
第 2 步:退出登录,在全新会话里跑每一条
退出账号。用无痕窗口。别让助手看到你的历史记录,因为个性化会悄悄递给你一个好看的结果,而你会信。
把同样这 20 条提示词在你在乎的每个助手上跑一遍。大多数团队挑三个:ChatGPT、Google AI Mode 和 Perplexity。卖给开发者就加上 Claude。卖给那种 IT 部门给所有人统一配了微软的大公司,就加上 Copilot。
别六个全上。每多一个助手,工作量就乘以二十条提示词,还会给你的均值添噪音,而你要做的决定一个都不会因此改变。
第 3 步:记四个独立栏位,不是一个总分
工具会把这些压成一个数字,而它们压扁掉的那些细节,恰恰就是告诉你下周该修什么的细节。
| 栏位 | 含义 | 为什么值得单独一栏 |
|---|---|---|
| 被提到 | 你的品牌出现在回答里的任何地方 | 最便宜拿到,信号最弱 |
| 被推荐 | 你被当作建议选项呈现 | 和销售线索走势对得上的那一个 |
| 被引用 | 你的域名作为带链接的来源出现 | 真正带来流量的那一个 |
| 还有谁出现 | 回答里的其他所有品牌 | 整张表上最有用的一栏 |
前三栏分开的是三种真正不同的病。一个品牌可以一直被引用却从来不被推荐,那是内容问题。也可以被推荐却从来不被引用,那意味着模型认识你,但一个人也没往你这儿送。一个数字把两者都藏了起来。
第四栏几乎所有人都跳过,而它才是回本的那一栏。r/SEO 上有位 SEO 说得比我们好:最后这栏告诉你竞品为什么被挑中,而答案通常是对比文章、目录站和论坛帖子,而不是竞品自己网站上的任何东西。你不只是在量自己。你还免费拿到了一张地图,标着模型在你品类里信任哪些第三方页面,而挤进那些页面,几乎总是比在排名上超过它们容易。
第 4 步:对着三个点名的竞品算声量份额
每条提示词都记下哪些竞品出现了。然后算声量份额:你的提及数除以这组里所有品牌的提及总数。
挑三个竞品,把这份名单钉死。在不同月份之间换掉对比对象,是这世上伪造进展最容易的办法,而且如果你是在向别人汇报,对方迟早会发现。
第 5 步:把无聊的元数据记下来
日期、助手、能看到的话记下模型版本、国家,以及你当时是不是退出登录状态。
跳过这一步,下个月的对比就一文不值,因为你不会知道是数字动了还是条件动了。我们跳过过。它确实一文不值。
第 6 步:每月在完全相同的提示词组上重复
同样的提示词、同样的顺序、同样的条件。换了这组,你就是开了一个新实验,而不是把旧的接着做。
每月一次对几乎所有人都是对的节奏。每周基本上是在量噪音,每季度又慢到你已经忘了自己当初在测哪一次内容改动。
手动审计之外,该配哪些免费工具?
四个,都免费,而它们合起来覆盖了你那组提示词够不着的另一半画面。
- Search Console 的生成式 AI 报告。 来自 AI 概览和 AI Mode 的展示次数,直接来自 Google。没有点击也没有搜索词,所以在拿它写报告之前,先读一下它显示什么、又藏了什么。
- Bing Webmaster Tools。 就算必应一点流量都不给你,也去验证一下站点。它的 AI Performance 面板会报告 grounding queries,也就是助手跑去找资料时给自己写的那些短语。这是唯一有人公开的、免费的查询级数据。
- GA4,按来源来路拆开。 从 chatgpt.com、perplexity.ai 之类过来的流量。对大多数站点来说,今天这个量看着很小,但它是这份清单里唯一和收入连着的一栏。
- 你的服务器日志或 CDN 面板。 哪些 AI 爬虫在抓什么,以及有没有东西在挡它们。
第四条值得加个提醒,因为这正是很多 GEO 建议兴奋过头的地方。爬虫访问是真问题,值得查一次。但它很少是坏掉的那个。今年审过大约 17000 个小企业网站的一位 SEO 在 r/SEO 上总结道:访问几乎从来不是瓶颈,robots.txt 通常没问题,GPTBot 通常也没被挡。真正弄死这些站的是,页面上没有任何东西能被拎出来当答案。
要点: 爬虫访问查一次,坏了就修,然后别再盯着它。把机器人日志当成你的排查层,把提示词审计当成你真正的 KPI。
想被引用,是不是非得在 Reddit 上?
比那些建议说的要少,而且现在有一份很大的数据把标准答案搅复杂了。
Ahrefs 分析了 140 万条 ChatGPT 提示词,结果发布于 2026 年 4 月。ChatGPT 引用了它检索到的网址中的大约一半。有意思的是按来源类型拆开:从它自己搜索索引里拉来的结果,被引用的比例是 88.46%,而 Reddit 是 1.93%,YouTube 是 0.51%,学术来源是 0.40%。
也就是说,模型大量地读这些地方,却很少引用它们。在 Reddit 上被讨论,确实可能塑造模型对你品类的看法。但作为一条通往真实引用的路径,它远比不上你自己那个把问题干净利落答完的页面。
有句话得直说:Ahrefs 自己就卖 AI 可见度产品,所以他们在这场比赛里有马。我们引用他们,是因为样本极大、方法公开,不是因为他们中立。
同一份研究里还有两个结论值得贴在显示器上。网址 slug 用自然语言写的页面被引用的比例是 89.78%,没这么写的是 81.11%。被引用页面在标题和查询之间的语义相似度也更高,0.602 对 0.484,后者是被检索到之后又被略过的那些。
这是个无聊得可爱的结论。写一个和别人真正会问的问题对得上的标题。用一个能读懂的网址。差不多就这些。
怎么知道一个变化是真的?
多数情况下你不知道,而这是做工具生意的人不会主动讲的部分。
助手的输出不是确定性的。同一条提示词跑两次,你可能拿到不同的品牌、不同的顺序,而你这边什么都没改。所以从 20 条里被提 6 次变成被提 8 次,在幻灯片里看着是 33% 的增长,同时又稳稳落在你同一个下午把同一组跑两遍就能得到的波动区间里。
两条规则能让你保持诚实。
- 第一天把基线那组跑两遍。 这两次完全相同的运行之间拉开多大的口子,那就是你的噪音底。任何比这个口子小的月度变化都不是结果,不管它在汇报材料里多好看。
- 在相信一个小变化之前,先把这组扩大。 二十条提示词给你的分辨率很粗。如果两个百分点的位移真的会改变一个商业决定,你需要的是 50 条或 100 条提示词,而不是一个更漂亮的看板。
还有第三个选项,一分钱不用花:每条提示词跑三次取平均,而不是只跑一次。跑一次是抛硬币。跑三次才叫测量。它会让你的下午变成三倍,所以我们只会对那几条真正有商业分量的提示词这么做。
老实说,这个领域里被报出来的月度变化,大多数是穿了西装的噪音。
分数难看的时候到底该做什么?
先修你的 SEO,而且这是 Google 的建议,不是我们的。
Google 面向生成式 AI 功能的优化指南直接自问现有的 SEO 做法是否仍然适用。它的答案是:“简单说,是的。SEO 的最佳实践依然有效,因为我们在 Google 搜索上的生成式 AI 功能植根于我们核心的搜索排名与质量系统。”它还往前走了一步,明说“为生成式 AI 搜索做优化,就是为搜索体验做优化,因此依然是 SEO”。
同一份指南列出了可以跳过的活儿:llms.txt 文件、内容分块、专门给 AI 的改写,以及去追那些不真实的提及。这是 Google 白纸黑字告诉你,四个流行的 GEO 手法是不必要的。它推荐的东西倒是既普通又难做:一个属于自己的观点、不是流水线货的内容、满足技术要求、像样的页面体验、更少的重复内容。
除此之外,你的审计会告诉你自己碰上的是三个问题里的哪一个。
被引用但从来不被推荐。 你的页面在描述功能,而提示词在问情境。这个差距通常靠改写来弥合:写买家正在完成的那件事,而不是你在卖的那样东西,这一点我们在客户异议与待办任务理论那篇里展开过。
被推荐但从来不被引用。 模型认识你,却一个人也不往你这儿送。通常的解释是,对那个说法而言,你自己的页面不是最干净的可用来源,于是它引用了别人对你的描述。
两样都没有,而竞品到处都是。 回到第四栏。那些反复出现的第三方页面就是你的目标清单,而挤进一个对比页或一个目录站,通常比在排名上超过它快。
关于 FAQ 板块,顺便说一句,因为所有人都会问。它们作为结构有用,作为花招没用,而且 Google 已经对大多数网站取消了 FAQ 富媒体结果,所以摘要奖已经没有了。真正有效的是写出一个不靠上面那段也站得住的答案,因为检索系统会把你的页面切成若干片段,逐片打分。有位 SEO 把眼下这一波问句式 H2 叫作“上个时代的关键词堆砌”,我们觉得他说对了一半。格式本身没问题。把它拧到什么都没回答的页面上,才是会失败的做法。
这一切全靠手工做,大概到第十二条提示词就不好玩了。把调研和一半的起草自动跑掉,差不多就是我们做 Aiter 的目的,不过第一次审计还是值得自己做,因为你正是在那里学会这些数字到底意味着什么。
不管怎样。现在就去问 ChatGPT 你的品类里最好的工具是什么,退出登录状态,就现在。回来的东西就是你真实的基线,而弄清楚它大概要四十秒。
常见问题(FAQ)
一次 AI 可见度审计要多久?
20 条提示词乘以三个助手,大约三个小时,其中大部分是复制粘贴。表格建好之后,第二个月大概一个小时。
我需要多少条提示词?
二十条看形状,50 条以上才能比较有信心地识别小变化。从 20 条开始,只有当一个真实决定取决于精度时才扩大。
提示词该登录跑还是退出登录跑?
退出登录,用无痕窗口。登录状态的结果反映的是你自己的历史,会让你的品牌出现得远比在陌生人那里频繁。
能用 ChatGPT 的 API 自动化吗?
能,但结果不会和消费级应用一致。网页界面在原始模型之上叠了检索、工具和系统提示词。想要量就去自动化,但别把 API 的输出当成买家看到的东西呈现。
多少算是好的 AI 可见度分数?
没有任何值得引用的基准,因为声量份额完全取决于你的品类有多挤。在固定提示词组上你自己的那条趋势线,是唯一有意义的对比。
被 AI 引用真的会带来流量吗?
有时候会,而且比引用次数暗示的要少。读到一段提及你的摘要的人,可能永远不会点进来。把引用当作被收录的证据,剩下的去 GA4 的来源数据里查。
有免费的 AI 可见度工具吗?
Search Console 和 Bing Webmaster Tools 都免费提供 AI 数据,两者合起来覆盖了 Google 和微软的界面。至于其他所有助手,免费的选项就是你自己的时间和一张表格。
这件事必须每月做吗?
每月一次适合大多数团队。每周基本是在量噪音,每季度又太慢,没法把一个效果和引起它的那次内容改动接上。