正如 Googlebot 抓取网络以构建搜索索引一样,AI 公司也运营自己的爬虫来驱动其语言模型和答案引擎。主要的 AI 爬虫有:
- GPTBot —— OpenAI 的爬虫,用于训练 GPT 模型并为 ChatGPT 的浏览功能提供支持。User-agent:
GPTBot。 - ClaudeBot —— Anthropic 用于 Claude 模型训练的爬虫。User-agent:
ClaudeBot。 - PerplexityBot —— Perplexity AI 用于搜索答案中实时网络检索的爬虫。User-agent:
PerplexityBot。 - Google-Extended —— Google 用于 Gemini 模型训练的独立爬虫(与 Googlebot 不同)。User-agent:
Google-Extended。 - Applebot-Extended —— Apple 用于 Apple Intelligence 训练的爬虫。
控制 AI 爬虫的访问权限:AI 爬虫会遵循 robots.txt 指令。可以通过指定其 user-agent 名称来单独允许或阻止每一个爬虫。阻止它们可以防止你的内容被用于训练或实时检索,但同时也会使你的网站从 AI 生成的答案中消失。
User-agent: GPTBot\nAllow: /\n\nUser-agent: ClaudeBot\nAllow: /\n\nUser-agent: PerplexityBot\nAllow: /\n\nUser-agent: Google-Extended\nAllow: /SearchVitals 检查的内容:GEO / AI Visibility 模块会解析你的 robots.txt,并报告每个主要 AI 爬虫是允许、被阻止还是受到部分限制——将全面阻止标记为严重或警告发现。