robots.txt 文件位于 https://example.com/robots.txt。爬虫在抓取任何其他页面之前会先获取该文件,并遵循其中的指令来确定自己可以访问哪些路径。
基本语法:
User-agent: *\nDisallow: /admin/\nAllow: /\n\nSitemap: https://example.com/sitemap.xmlUser-agent: * 将规则应用于所有爬虫。也可以通过各自的 user-agent 名称来针对单个爬虫(Googlebot、GPTBot、ClaudeBot)进行设置。
关键区别:robots.txt 控制的是抓取访问,而非索引。被 robots.txt 屏蔽的 URL 无法被抓取,但如果其他页面链接到它,Google 仍然可能将其收录。要阻止索引,应使用 noindex meta 标签——但这要求页面能够被抓取。
常见错误:意外屏蔽了 CSS 或 JavaScript;无意中屏蔽了 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot);从暂存环境遗留下 Disallow: /。
SearchVitals 的检查方式:Technical SEO 审计会获取并解析 robots.txt,识别出屏蔽了重要页面、AI 爬虫或 sitemap 的规则。GEO / AI Visibility 模块则专门检查 AI 爬虫是被允许还是被屏蔽。