GEO / AI 可见性 schedule 9 分钟阅读

如何成为 AI 答案所引用的来源

每家主流 AI 供应商都为模型训练和搜索检索运行不同的 agent —— 而且其中不止一个决定你是否会被引用。大多数建议点错了对象,也没有任何供应商会告诉你真正的门槛在哪里。

目标

当 AI 答案引擎回答一个关于你所在领域的问题时,你希望 你的品牌成为被引用的对象 —— 也就是它点名并链接的那个来源。在用户已不再点击跳转的那些查询上,被引用胜过排名。

AI 引用是如何运作的

当 AI 答案引擎回答问题时,它并不只依赖模型自身的记忆 —— 它会检索实时页面,并引用其中的一部分。这个检索环节就是全部的关键,而它运行在普通网页爬虫、普通 user agent 之上。这意味着第一个问题不是“我的内容是否好到值得被引用”,而是“负责引用的那个爬虫是否被允许进来”。

结果证明,在每家主流供应商那里,这些都是不同的 agent —— 而且每个平台不止一个。把它们混为一谈,是整个主题中最严重的错误。

几乎所有人都搞错的区别

每家主流 AI 供应商都为模型训练和搜索检索运行不同的 user agent,而对引用真正起作用的那些,恰恰不是大多数 SEO 建议所点名的。被广泛重复的“屏蔽 GPTBot 以保护你的内容”这条指令,针对的是一个训练爬虫;而当有人提问时真正抓取你页面的那些 agent,却往往没有被审视。

在查看表格之前,有两点提醒。第一,一次引用涉及不止一个 agent:就 ChatGPT 而言,OAI-SearchBotChatGPT-User 都参与其中,屏蔽任何一个都可能让你付出代价。第二 —— 这也是几乎所有指南都搞错的一点,包括本文的早期版本 —— 没有任何供应商曾声明训练与检索之间的划分是绝对严密的。文档告诉你每个 agent 是用来做什么的,但它不会告诉你是什么决定你是否被引用,也不会告诉你这些系统在实践中是否真的像标签所暗示的那样彼此分离。

供应商 参与检索与引用
屏蔽其中任何一个都可能让你付出代价
文档标注为仅用于训练
OpenAI / ChatGPT OAI-SearchBot, ChatGPT-User GPTBot
Anthropic / Claude Claude-SearchBot, Claude-User ClaudeBot
Perplexity PerplexityBot, Perplexity-User —(声明其没有)
Google — 搜索 & AI Overviews Googlebot —(Google-Extended 不影响这些)
Google — Gemini Googlebot,然后是 Google-Extended * Google-Extended *

* Google-Extended 是故意同时出现在 Gemini 的两列中的。它是一个单一的 robots.txt 令牌,同时管辖训练 grounding,因此与这里所有其他供应商不同,Gemini 让你无法在不失去其中一项的情况下拒绝另一项。下文将说明原因。

上述每一项归属都来自供应商自己的文档,而非推断:

“OAI-SearchBot 用于在 ChatGPT 的搜索功能中让网站在搜索结果里呈现。”……“GPTBot 用于抓取可能被用于训练我们生成式 AI 基础模型的内容。”

OpenAI,《Bots and crawlers》文档

Anthropic 划出了同样的界限:其文档Claude-SearchBot 描述为浏览网络“以提高用户的搜索结果质量”,而 ClaudeBot 则收集“可能对其训练有所贡献的网页内容”。Perplexity 的特殊之处在于它根本没有训练爬虫 —— 它声明 PerplexityBot “旨在让网站在 Perplexity 的搜索结果中呈现并被链接。它不用于为 AI 基础模型抓取内容。”

Google 的情况最常被误解

Google 的 AI Overviews 建立在普通搜索索引之上,因此在那里起作用的爬虫就是普通的 GooglebotGoogle-Extended 根本不是爬虫 —— 它没有独立的 user agent,抓取是由普通 Googlebot 完成的,而 robots.txt 令牌是叠加在上面的权限控制。屏蔽它并不会让你从 AI Overviews 中消失:

“Google-Extended 不会影响网站是否被纳入 Google 搜索,也不会被用作 Google 搜索的排名信号。”

Google Search Central,《Google common crawlers》文档

但它并不是一个仅用于训练的开关,而把它当成仅用于训练的开关,正是本节要防止的错误。同一份文档指出,Google-Extended 管辖着用于“训练未来一代 Gemini 模型(为 Gemini Apps 和 Vertex AI API for Gemini 提供动力)”的内容使用,以及这些产品中的 grounding。Grounding 就是检索环节 —— 它是 Gemini 触达实时页面并引用它的方式。

因此,屏蔽 Google-Extended 会同时做两件事,而且你无法将它们分开:它拒绝 Gemini 训练,同时把你从 Gemini 的 grounded 答案中移除。表格中的其他每家供应商都允许你拒绝训练同时保持可被引用,Google 却不允许。如果 Gemini 的曝光对你很重要,Google-Extended 就必须保持不屏蔽 —— 你的内容进入 Gemini 训练,就是这一点的代价。

这在实践中意味着什么:文档所述的用途表明,你可以一边拒绝训练一边保持可被引用 —— 但没有人验证过这种分离是否成立,而且风险是单方面的。允许训练 agent 不会让你付出任何可衡量的代价;屏蔽它们所换来的好处同样无法衡量,却要面对一个你数月之内都不会察觉、即便察觉也无法归因的坏处 —— 在 AI 答案中的存在感变得更微弱。除非你在保护付费墙内容或授权内容,否则请允许全部 agent。如果你确实有值得保留的内容,请有意识地屏蔽训练 agent,写下原因,并在之后观察你的被提及量,而不是假定那些标签真的成立。

用两分钟检查你自己的 robots.txt

要留意的失效模式,是一套早于这一切的通配规则,或是一段从博客文章里复制来的“屏蔽 AI 爬虫”的笼统片段。打开你的 /robots.txt,检查是否有任何 Disallow: / 触及上表第一列中的那些 agent —— 无论是直接点名,还是通过 User-agent: * 且没有更具体的覆盖规则。这种意外的通配规则远比刻意的策略常见。

对大多数商业网站而言,正确的配置就是最平淡无奇的那种 —— 完全不设任何针对 AI 的屏蔽,让表格中的每一个 agent 都能触达你:

User-agent: *
Allow: /

只有当你拥有值得保留的付费墙内容或授权内容时,才值得专门拒绝训练。写法如下 —— 并注意两点提醒:这是在赌一种没有任何供应商确认过的分离,而且 Google-Extended 那一行会让你同时失去 Gemini 引用和 Gemini 训练,因为同一个令牌同时覆盖两者:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

Googlebot 无论哪种情况都无需任何条目 —— 让它保持不屏蔽,就像你对待普通搜索那样。如果你不想手动阅读这些规则,我们的 免费 robots.txt 检测工具 会针对你的线上文件检查这些 agent。

robots.txt 完全无法管辖的路径

以上所有内容都假设 AI 系统在爬取你。但还有第二条让你的页面触达答案引擎的路径,而 robots.txt 对它毫无发言权:有人把你的 URL 粘贴到聊天中,要求它读取那个页面。

Google 将这一类单独记录为用户触发的抓取器(user-triggered fetchers)—— Google-Agent,“由托管在 Google 基础设施上的 agent 使用,用于在用户请求下浏览网页并执行操作”,以及用于 Gemini Notebook 的 Google-GeminiNotebook。文档中直白地写明了关键性质:用户触发的抓取器“通常忽略 robots.txt 规则”,因为发出抓取请求的是人,而不是自行决定的爬虫。

这个后果是双向的。如果你的目标是让你的内容彻底不进入 AI 产品,robots.txt 从来就无法做到这一点 —— 读者可以把你的 URL 交给一个助手,抓取照样发生。而如果你的目标恰恰相反,一条对陌生 user agent 进行质询的 WAF 规则,即便在一个 robots.txt 允许一切的网站上,也会悄无声息地破坏这条路径。只有服务器或 CDN 规则能管辖它,因此只有一次真实的请求才能检验它。

其他平台也是如此:ChatGPT-UserClaude-UserPerplexity-User 在其各自平台上就是为了等效的用户发起抓取而存在的,这就是为什么它们位于上表的检索列,而不是被当作无关紧要的东西归档一旁。

什么让一个来源可被引用

爬虫的访问是必要条件,但不是充分条件。一旦检索成为可能,问题就变成了:你的页面是否容易提炼出一句站得住脚的话。

信号 为什么重要
直接的一句话答案 答案引擎需要一个干净、可引用的、能够归属的陈述 —— 被埋没的结论会被跳过
问句式标题 与人们的提问方式相匹配的标题,能给检索一个明显的锚点
每条论断都标注来源 引用一手来源的页面,比一个没有任何出处却断言数字的页面,对 AI 而言复述起来更安全
可见的作者资质 署名与专业性是区分可引用来源和匿名页面的关键
服务端渲染的内容 检索爬虫并不保证会执行 JavaScript —— 只有在 hydration 之后才存在的内容可能永远不会被看到
一个具体、可核查的事实 提供数字、定义或步骤的页面会被引用;提供观点的页面很少被引用

注意这份清单中缺失了什么:关键词密度、字数,以及任何针对 AI 的标记。Google 明确表示 不需要任何特殊的 schema 或 AI 文本文件 —— 但要读懂这句话的真实含义。它的适用范围仅限于 Google 自己的 AI 功能,而且 Google 自己也是这么说的:措辞是“出现在这些功能中”。OpenAI、Anthropic 和 Perplexity 根本没有发布任何同等的指引。它们的爬虫文档只说明每个 agent 的用途;没有一个说明什么能赢得引用。

所以诚实的立场是:在这些公司之外,没有人知道门槛在哪里。这种不对称性意味着,你应该做得比 Google 的最低要求更多而非更少:干净的机器可读摘要、明确的产品与实体数据、服务端渲染的内容,以及一个 llms.txt,这些都很便宜,都不会损害你的 Google 表现,而且它们是你面对那些不发布任何规则手册的平台时唯一可用的对冲手段。让一个页面变得可被引用的工作,很大程度上就是让一个页面一直都很出色的工作 —— 只是多留了一份心,看机器能否提炼出单独一句话并为之背书。

追踪你是否真的在被引用

可被引用只是等式的一半 —— 你还需要知道它是否在起作用,而引用数据并不在 Search Console 里。SearchVitals AI Visibility 衡量你的品牌在 ChatGPT 和 Google AI Overviews 中被提及的数量、触发这些提及的关键词,以及你的覆盖度与指定的竞争对手相比如何。

如果你特别想了解 Google 这一侧的机制 —— 数据对点击量说明了什么,以及 Google 自己告诉发布者该怎么做 —— 请看 我们的 Google AI Overviews 指南

常见问题解答

屏蔽 GPTBot 会让我不再被 ChatGPT 引用吗? expand_more
根据 OpenAI 的文档,两者的职责不同:GPTBot 抓取的是可能用于训练基础模型的内容,而 OAI-SearchBot 在 ChatGPT 的搜索功能中呈现网站,ChatGPT-User 则在某个问题需要时抓取页面。因此从纸面上看,屏蔽 GPTBot 只会拒绝训练,而不会让你从引用中消失。但 OpenAI 从未声明这种分隔是绝对可靠的,也没有任何服务商公布究竟是什么决定引用——所以请把它当作一个合理的推断,而非保证。
每个 AI 平台我需要允许哪些爬虫? expand_more
每个平台涉及的代理不止一个。ChatGPT:OAI-SearchBot 和 ChatGPT-User。Claude:Claude-SearchBot 和 Claude-User。Perplexity:PerplexityBot 和 Perplexity-User。Google AI Overviews:普通的 Googlebot。文档标明仅用于训练的代理是 GPTBot 和 ClaudeBot;Perplexity 则表示自己完全不为基础模型训练而抓取。Google-Extended 不属于那一组——它是一个同时涵盖 Gemini 训练和接地的 robots.txt 令牌,所以屏蔽它也会让你从 Gemini 的引用回答中消失。
屏蔽 Google-Extended 安全吗? expand_more
只有在你愿意失去 Gemini 的前提下才安全。它不影响 AI Overviews——Google 表示它既不影响被 Google 搜索收录,也不作为排名信号,而 AI Overviews 运行在普通的搜索索引上。但它是一个同时涵盖 Gemini 训练和接地的单一令牌,而接地正是 Gemini 检索并引用实时页面的方式。与 OpenAI、Anthropic 和 Perplexity 不同,Google 不给你任何办法在拒绝训练的同时继续被 Gemini 引用。
我可以拒绝 AI 训练但仍然被引用吗? expand_more
文档中的用途说明暗示可以,但没有人验证过,而且风险是单方面的:允许训练代理不会给你带来可衡量的成本,而屏蔽它们则可能让你在 AI 回答中的存在感变弱,这种变化你可能几个月都察觉不到,也无法归因。除非你在保护付费或授权内容,否则就把它们全部允许。如果你确实要屏蔽训练代理,请有意为之,并在之后观察你的被提及量。
robots.txt 能完全阻止 AI 读取我的页面吗? expand_more
不能。如果有人把你的 URL 粘贴到助手并让它读取该页面,这个请求就是一次用户触发的抓取,而 Google 在文档中说明,Google-Agent 和 Google-GeminiNotebook 等用户触发的抓取器通常无视 robots.txt 规则。那条路径只受服务器或 CDN 规则约束——这也意味着,在一个 robots.txt 全部允许的网站上,一个对陌生用户代理发起质询的 WAF 可能会悄然破坏这条路径。
要被引用,我需要特殊 schema 或 AI 文本文件吗? expand_more
就 Google 而言不需要——它表示要出现在其 AI 功能中,你不需要机器可读文件、AI 文本文件或特殊的 schema.org 结构化数据。请注意范围:这只涵盖 Google 的 AI 功能。OpenAI、Anthropic 和 Perplexity 均未发布任何方向性的指导,所以这些公司之外没有人知道它们的门槛在哪里。满足 Google 的基线,然后做一些成本低廉的额外工作——清晰的结构、无歧义的实体数据、服务端渲染的内容——作为对冲。
我如何知道自己是否真的被引用了? expand_more
引用数据不会出现在 Search Console 中。SearchVitals 的 AI 可见性(AI Visibility)衡量的是你在 ChatGPT 和 Google AI Overviews 中的品牌提及量、触发这些提及的关键词,以及你与指定竞品的对比情况。

看看 AI 是否在引用你

运行一次免费审计,然后追踪你品牌的 AI 可见性。

免费审计