find_in_page 技术 SEO 诊断

Robots.txt 校验工具

检查 robots.txt 的指令是否写对、Sitemap 声明是否可用,以及有没有会误伤搜索引擎的语法错误。

language

robots.txt 与 Sitemap 的正确配置方式

配置得当的 robots.txt 能让爬虫把抓取预算花在真正有价值的页面上,而不是消耗在后台路由、带参数的重复地址和内部接口上。

一份健康的 robots.txt 该做到什么

  • 声明 XML Sitemap: 在文件末尾添加一行绝对地址的 Sitemap: https://yourdomain.com/sitemap.xml
  • 采用 llms.txt 规范: 提供一份 Markdown 格式的 /llms.txt,让 ChatGPT、Claude、Perplexity 这类系统更容易读懂你的核心文档和产品页。
  • 不要误伤 CSS 与 JS: 渲染页面所需的 CSS、JavaScript 和媒体资源不要屏蔽,否则搜索引擎看到的会是一个排版错乱的页面。
  • 注意大小写: 多数服务器上 robots.txt 的路径规则区分大小写,/Admin 和 /admin 是两回事。

常见问题

为什么要在 robots.txt 里声明 XML Sitemap?

这是让爬虫自己找到站点结构最省事的方式。在 robots.txt 末尾写一行 Sitemap: https://yourdomain.com/sitemap.xml,Googlebot、Bingbot 以及各家 AI 爬虫都会读取——不用挨个到站长后台提交。注意必须写完整的绝对地址。

robots.txt 有语法错误会怎样?

后果通常不是报错,而是规则悄悄按你没预期的方式生效。常见的是路径写错导致重要页面被挡在外面,或者误伤了渲染页面所需的 CSS 和 JS,让搜索引擎看到一个排版错乱的版本。这类问题不会有任何提示,只能靠检测发现。