为什么 GEO 现在很重要
人们获取信息的方式,正经历着自智能手机问世以来最快的变革。2024 年,Google 面向全美用户推出了 AI Overviews——在数千万条查询的自然结果之上,放置一个 AI 生成的答案。这对自然点击的影响十分剧烈,而且已有充分的数据记录:
“AI Overviews 查询的自然点击率(CTR)从 1.76% 跌至 0.61%。”
— Search Engine Land,报道了一项针对 42 家机构、3,119 条查询的研究(2024 年 6 月–2025 年 9 月)
与此同时,越来越多的信息搜索正在彻底绕开 Google。OpenAI 官方确认的最后一个数字是 ChatGPT 周活跃用户 9 亿,2026 年 2 月 27 日公布;此后的报道显示该数字已显著更高,而 OpenAI 并未发布更新后的统计。Microsoft Copilot 已深度集成进 Windows 和 Edge。曾经在搜索框里输入关键词的用户,如今在对话界面里提问——而与他们对话的 AI,决定着引用哪些来源。
如果你的网站没有为 AI 检索做好结构化准备,它就不会被引用;而如果它不被引用,它在这个渠道里就等于不存在。
“生成式引擎优化(generative engine optimization)”现在就处在 2012 年“移动端 SEO”的位置——有真实的搜索需求,但几乎没有权威内容,也尚未出现占据主导地位的内容品牌。以成熟 SEO 关键词的标准来看,这些词目前的难度仍然很低,而且随着越来越多的网站意识到这个机会,难度会持续上升。请以你自己关键词的实时数据为准,而不要轻信任何文章里发布的数据(包括本文)——这些数字变化很快。
AI 系统如何发现你的内容
传统搜索引擎依靠 Googlebot 抓取网页并建立索引。AI 系统的工作方式类似——它们运行各自专门的爬虫,访问网站以收集训练数据并支撑实时检索。理解这些爬虫,是 GEO 的基础。
主要 AI 爬虫
每个主流 AI 平台都运行着一个有名称的爬虫,并在 HTTP User-Agent 请求头中表明自己的身份:
| 爬虫 | 平台 | User-Agent | 用途 |
|---|---|---|---|
| OAI-SearchBot | OpenAI (ChatGPT) | OAI-SearchBot | 检索 —— 让网站在 ChatGPT 搜索中被展示 |
| ChatGPT-User | OpenAI (ChatGPT) | ChatGPT-User | 检索 —— 当用户的问题需要时抓取页面 |
| GPTBot | OpenAI (ChatGPT) | GPTBot | 仅用于训练数据 |
| Claude-SearchBot | Anthropic (Claude) | Claude-SearchBot | 检索 —— 改善 Claude 搜索结果 |
| Claude-User | Anthropic (Claude) | Claude-User | 检索 —— 在回答用户问题时访问网站 |
| ClaudeBot | Anthropic (Claude) | ClaudeBot | 仅用于训练数据 |
| PerplexityBot | Perplexity AI | PerplexityBot | 检索 —— Perplexity 声明其不用于基础模型训练 |
| Perplexity-User | Perplexity AI | Perplexity-User | 检索 —— 访问页面以回答特定问题,并在回复中附上链接 |
| Google-Extended | Google (Gemini) | Google-Extended | 既用于 Gemini 训练又用于接地(grounding)——一个 token 同时覆盖两者。屏蔽它会损失 Gemini 的引用。它不影响 Google 搜索:Google 声明它“不影响网站在 Google 搜索中的收录”,而 AI Overviews 运行在普通 Googlebot 上 |
| Applebot-Extended | Apple (Apple Intelligence) | Applebot-Extended | Apple Intelligence 训练 |
所有这些爬虫都遵守 robots.txt,而且你可以通过指定它们的 user-agent 名称,逐个独立地允许或屏蔽。资料来源:OpenAI — GPTBot documentation、Anthropic — Claude crawlers、Perplexity — bots documentation,以及 Google — common crawlers。
被 AI Overview 引用与更多点击相关,而非更少
同一项研究还发现,虽然 AI Overviews 整体上大幅削减了自然点击率(CTR),但真正被 AI Overview 引用的品牌,其自然点击比在同一查询上排名却未被引用的品牌多出 35%,付费点击多出 91%——这意味着,在 AI Overview 查询中,真正决定流量的已不再是排名位置,而是是否被引用。
来源:Search Engine Land, reporting a study of 3,119 queries across 42 organizations(2024 年 6 月–2025 年 9 月)。
这里还常被引用的另一个数字值得一并对照:Pew Research(皮尤研究中心)发现,在出现 AI 摘要的访问中,用户点击摘要内部来源链接的比例仅有 1%。两个数字并不矛盾,因为它们统计的是不同的东西——引用链接本身很少被点击,而被引用与同一查询下普通自然结果获得更多点击相关。请把引用视为提升你现有排名列表的品牌曝光,而非一个独立的流量渠道。完整分析 →
你应该允许 AI 爬虫吗?
这个问题其实是两个问题,而把它们混为一谈是这个领域最常见的错误。检索代理(retrieval agents)几乎总是应该被允许——而且要注意,每个平台都不止一个。ChatGPT 涉及 OAI-SearchBot 和 ChatGPT-User;Claude 涉及 Claude-SearchBot 和 Claude-User;Perplexity 涉及 PerplexityBot 和 Perplexity-User;AI Overviews 则运行在普通 Googlebot 上。屏蔽其中任何一个,都可能让你失去一次被引用的机会。
训练代理(training agents)在纸面上是另一回事——GPTBot、ClaudeBot 和 Applebot-Extended 在文档中被标注为仅用于训练。但请如实看待这一点:这只是根据已公布的爬虫用途得出的推断。没有任何厂商曾声明这种区分是绝对可靠的,也没有任何厂商公布真正决定引用的因素。
Google-Extended 是个例外,而且它不是训练代理。Google 的文档称,它同时管辖内容用于训练 Gemini 模型和在这些产品中接地(grounding)的用途——而 grounding 就是让 Gemini 能访问实时页面并加以引用的那个检索步骤。一个 token 同时覆盖两者,所以屏蔽它会在同一个动作里既拒绝 Gemini 训练,又把你从 Gemini 的接地回答中移除。在本文所列的所有厂商中,唯独 Google 没有提供既退出训练、又保持可被引用的办法。
风险是单方面的,这也就解决了实际问题。允许训练代理不会给你带来任何可衡量的代价;屏蔽它们换来的好处同样无法衡量,却要承担一个代价——在 AI 回答中更加隐形——这个代价你可能数月都察觉不到,即使察觉了也无法归因。除非你要保护付费或授权内容,否则请允许所有爬虫。如果你确实有值得保留的内容,那就刻意地屏蔽训练代理、记录下原因,并在事后观察你的 AI 提及量,而不是想当然地认为标签会一直成立。要避免的是相反的失败模式:一个笼统的 Disallow: /,或从某篇博客文章里复制来的“屏蔽 AI 爬虫”代码片段,悄悄地把检索代理也一并屏蔽了。可参考 AI 引用完整指南 获取一份现成的 robots.txt 配置。
要检查你网站的 robots.txt 如何处理 AI 爬虫,可使用 AI 爬虫检测工具——它会同时检测所有主流 AI 爬虫,并标出任何被屏蔽的爬虫。
llms.txt —— 它是什么,以及不是什么
llms.txt(AI 爬虫的站点说明文件)是一种 Markdown 文件,为 AI 代理提供一份经过精心整理的、网站最有价值内容的导览图。它由 Answer.AI 的 Jeremy Howard 于 2024 年 9 月 3 日提出,并于 2026 年 8 月 10 日修订为 v2 版本。它解决的是 token 经济问题,而不是营销问题:HTML 页面把信息包裹在导航、广告和 JavaScript 里,而上下文窗口仍然太小,无法一口气吞下整个网站。
它的采用是真实存在的——OpenAI、Anthropic 和 Gemini 都为各自的开发者文档发布了一份,而 Chrome 的 Lighthouse 也在其智能体浏览检查中审计网站是否有该文件。但有必要直白地说清楚它的局限:Google 并不使用它。Google Search Central 明确表示,你无需创建“机器可读文件、AI 文本文件或标记”,也能出现在 AI Overviews 或 AI Mode 中;Gary Illyes 也在 2025 年 7 月的一次 Search Central 活动上表示,Google 不支持 llms.txt,也没有支持它的计划。
不过请注意这句话的适用范围。Google 的措辞是“出现在这些功能中”——它谈的是 Google 自己的 AI 功能。OpenAI、Anthropic 和 Perplexity 对这个话题均未发表任何表态。Google 根本不是这份文件的目标受众。
所以,不要指望靠它提升 Google 排名。但可以把它视为面向 Google 之外的智能体生态的低成本、低风险工作的一部分——那才是该文件被记录在案的采用之处。
v2 的确切格式与真正必需的内容、在子路径下的放置方式、大多数指南都忽略的 Markdown 页面方案,以及五个值得避免的误区。
Google AI Overviews
AI Overviews 是出现在传统结果之上的 AI 生成摘要,它综合多个页面的内容给出答案,并链接其所引用的来源。它们运行在普通的 Google 搜索索引之上,而非一个独立的 AI 索引——这正说明,控制它们的那些杠杆,是你已经熟悉的东西。
Pew Research Center(皮尤研究中心)追踪了 900 名美国成年人在 2025 年 3 月共 68,879 次 Google 搜索中的真实浏览数据,发现在出现 AI 摘要的访问中,用户点击传统结果的比例为 8%,而在没有 AI 摘要的访问中为 15%。不过,真正应该影响你策略的是另一个数字:在那些访问中,点击摘要内部来源链接的比例仅为 1%。被引用是一种品牌曝光的结果,而非一个流量渠道。
关于该怎么做,Google 的表述异常直白:
“出现在 AI Overviews 或 AI Mode 中没有任何额外要求,也不需要其他特殊优化。”
— Google Search Central,AI features and your website
所以:做好自然排名、保持 Googlebot 不被屏蔽、用一句干净利落的话直接回答问题,并在服务端渲染你的内容。
这里对 Google 所说的一切都适用一个提醒:按其自己的措辞,这些内容仅适用于 Google——“出现在这些功能中”。ChatGPT、Claude 和 Perplexity 都没有发布对等的指导,所以满足 Google 的最低要求,并不能让你了解它们的门槛。先达到 Google 的要求,再为那些什么都没告诉你的引擎做一些低成本、额外的功夫。
Pew 的完整数据及其含义、置于上下文中引用的 Google 官方指引、仍然有效的杠杆——以及那些流行却没有任何文献依据的“GEO”手段。
如何被 ChatGPT、Claude 和 Perplexity 引用
ChatGPT 搜索、Claude 的联网搜索和 Perplexity 在回答时都会检索实时页面,然后引用其中一部分。这种检索运行在普通爬虫之上——因此,首先要检查的是爬虫访问权限,而不是内容质量。
这里有一个关键细节,也是大多数 SEO 建议搞错的地方:每个主流厂商都为模型训练和搜索检索运行不同的 user agent——而且一次引用往往涉及不止一个。对 ChatGPT 来说是 OAI-SearchBot 和 ChatGPT-User;对 Claude 是 Claude-SearchBot 和 Claude-User;对 Google AI Overviews 则是普通的 Googlebot,因为 Google-Extended 管辖的是 Gemini 的训练和接地,所以屏蔽它会让你损失 Gemini 的引用,尽管按 Google 的说法,它“不影响网站在 Google 搜索中的收录”。真正只用于训练的代理(GPTBot、ClaudeBot)看起来可以分开处理——但没有任何厂商说过这种区分是绝对可靠的,所以除非你在保护付费内容,否则请全部允许。
一旦检索成为可能,能否被引用就取决于:机器能否从你的页面中提炼出一句站得住脚的话,并愿意为其背书——直接的答案、问题式的标题、标明来源的论断、署名的作者,以及在 JavaScript 运行之前就已存在的内容。
涵盖全部四家厂商的完整爬虫对照表(附第一方来源)、一份既能拒绝训练又可保持可被引用的 robots.txt 配置,以及让一个来源“可被引用”的因素。
GEO 与传统 SEO:关键差异
| 维度 | 传统 SEO | GEO |
|---|---|---|
| 目标系统 | Google/Bing 排名算法 | AI 答案引擎(ChatGPT、Perplexity、AIO) |
| 成功指标 | SERP 排名前 1–3 名 | 在 AI 生成的答案中被引用 |
| 主要信号 | 外链 + 关键词相关性 | 内容清晰度 + 权威性 + 结构 |
| 内容形式 | 为关键词密度、内链优化 | 为直接的问答抽取优化 |
| 技术重点 | 网站速度、Core Web Vitals、可索引性 | AI 爬虫访问权限、llms.txt、结构化数据 |
| 流量结果 | 点击进入网站 | 品牌提及 + 部分流量(零点击常见) |
| 域名权威度 | 至关重要——没有 DR 40+ 很难排名 | 中等——内容质量可以弥补较低的 DR |
GEO 与 SEO 是互补的。一个自然排名进入前 5 的页面,被 AI Overviews 引用的概率要高得多。一个结构良好的支柱页面在赢得 AI 引用的同时,也会赢得外链,从而提升自然排名。这两门学科相互促进。
如何对你的网站进行 GEO 审计
GEO 审计是对 AI 答案引擎能否触达、解析并引用你的页面所做的一次结构化检查。它与传统 SEO 审计不是一回事。一个网站可以通过全部 Core Web Vitals 指标、自然排名进入前五,却仍然对 ChatGPT、Perplexity 和 Google AI Overviews 隐形——因为这些系统用自己的 user agent 抓取,并且是基于它们所能抽取的内容来作答,而不是基于一份排好序的链接列表。
按以下顺序分四轮进行审计。每一轮都是下一轮的前提,因此打乱顺序会白费功夫。
-
首先审计爬虫访问权限
确认检索代理在 robots.txt 或 CDN 层未被屏蔽:OAI-SearchBot和ChatGPT-User、Claude-SearchBot和Claude-User、PerplexityBot和Perplexity-User,再加上普通的Googlebot。这决定了你能否被引用。仅用于训练的代理看起来可以分开处理,但没有人能保证这一点——除非你要保留付费内容,否则也请允许它们。这是最常失败的一轮,而且失败得很隐蔽:屏蔽通常是继承自某个启动模板或一条从未有人复核的机器人拦截规则,而一个笼统的Disallow: /会把检索代理连同其他所有东西一并屏蔽掉。如果它们无法抓取页面,审计中的其他任何一轮都没有意义。用 AI 爬虫检测工具 进行验证。 -
审计爬虫实际收到什么
有访问权限不等于有内容。大多数 AI 爬虫抓取的是原始 HTML,从不执行 JavaScript,因此客户端渲染的页面返回的只是一个空壳,而本应出现你的正文。在假定文字可见之前,请用 AI 原始 HTML 查看器 检查你价值最高的模板——产品页、定价页、支柱内容——在原始 HTML 中的样子。 -
审计你的机器可读信号
当内容既可触达又可读取后,检查你的 JSON-LD:它是否携带了读者——或者正在构建富结果(rich result)的搜索引擎——希望附加到页面上的作者、日期和实体身份信息?用 结构化数据与 GEO 就绪度检测工具 给它打分。请清醒地看待它实际能带来的东西:Google 表示其 AI 功能不需要特殊的 schema,因此要把标记视为赢取富结果、如实陈述实体身份的手段,而不是撬动 AI 引用的杠杆。同样的提醒也适用于 llms.txt——如果编程代理和文档助手会阅读你的内容,它就值得发布;但 Google 并不使用它,而且如果你认定它适合自己,几分钟就能 免费生成一个。 -
最后审计内容结构
在技术层面清理干净之后,再审计写作本身:问题式标题在第一句话就给出答案、用具体数字而非含糊的断言、标明来源,以及可见的作者资质。这一轮决定你是被引用,还是仅仅被抓取。
每季度重新做一次审计,并在 CDN 迁移、框架升级或 robots.txt 修改之后务必再做一次——这些变更会在两次定期检查之间悄悄撤销 AI 爬虫的访问权限。下面的清单是每一轮的作业文件:前六项覆盖技术轮(1–3),后四项覆盖内容结构(第 4 轮)。
GEO 技术清单
用这份清单审计你网站的 GEO 就绪度。前六项是技术要求;后四项是内容优化。
-
在 robots.txt 中允许 AI 代理
检索代理绝不能屏蔽——OAI-SearchBot和ChatGPT-User、Claude-SearchBot和Claude-User、PerplexityBot和Perplexity-User,再加上普通的Googlebot。仅用于训练的代理(GPTBot、ClaudeBot、Applebot-Extended)原则上可以单独屏蔽,但没有任何厂商保证这种区分可靠。Google-Extended不在此列:一个 token 同时覆盖 Gemini 训练和接地,所以屏蔽它也会损失 Gemini 的引用。对大多数商业网站而言,正确的做法是全部允许,把屏蔽留给付费内容。用 AI 爬虫检测工具 进行验证。 -
创建并发布 llms.txt 文件
把它放在/llms.txt。包含你的网站名称、一段 blockquote 格式的描述,以及指向关键页面的分类链接。用 llms.txt 生成器 基于你现有的网站元数据生成一份。 -
确保页面在无 JavaScript 时也能正确渲染
许多 AI 爬虫抓取原始 HTML,不执行 JavaScript。用 AI 原始 HTML 查看器 检查你的关键内容页面是否在原始 HTML 中显示完整文字。 -
确认没有关键页面被 noindex 屏蔽
一条noindex指令会让页面同时从搜索引擎和 AI 系统中消失。用 Noindex 检测工具 测试你价值最高的页面。 -
为关键页面添加 Article 或 WebPage 结构化数据
在 JSON-LD 中包含datePublished、dateModified、author和publisher。Google 表示其 AI 功能不需要特殊的 schema,因此做这件事是因为它支持富结果,并明确无误地陈述作者身份和内容新鲜度——同时要确保dateModified反映的是真实的修订,而不是每次渲染都填上今天的日期。用 结构化数据与 GEO 就绪度检测工具 给任何页面的标记打分。 -
为首页添加带 sameAs 链接的 Organization JSON-LD
用sameAs把你的品牌实体链接到 Wikidata、Crunchbase 或 LinkedIn。这有助于 AI 系统识别并正确描述你的机构。 -
每个定义都以一句独立的话开头
你内容中定义的任何术语,都应在标题之后的第一处内容里,用一句话给出定义——而不是埋在某段文字中。 -
为高价值页面添加 FAQ 板块
FAQ 为 AI 系统提供了额外的问答对以供抽取。添加FAQPageJSON-LD 使它们机器可读。 -
使用署名和引用
用链接引用第一手来源(研究、官方文档、数据)。相比没有来源的说法,AI 系统更青睐展现出事实依据的内容。 -
保持内容最新
每次更新内容时,同步更新结构化数据中的dateModified。对于时效性强的查询,AI 系统更偏好近期的来源。