跳至主要内容
短.be

Robots.txt

放置在网站根目录的文本文件,用于指示搜索引擎爬虫哪些页面可以或不可以爬取。

2026年8月11日 · 约 1 分钟阅读

SEO

`robots.txt` 是放在 Web 网站根目录下、向搜索引擎爬虫指示抓取范围的文本文件。它可通过 `example.com/robots.txt` 访问,依据 Robots Exclusion Protocol (REP)。

`robots.txt` 的基本语法由四项构成:`User-agent` 指定对象爬虫,`Disallow` 指定禁止抓取的路径,`Allow` 指定允许抓取的路径,`Sitemap` 指定站点地图的 URL。`User-agent: *` 以所有爬虫为对象,`User-agent: Googlebot` 只以 Google 的爬虫为对象。

`robots.txt` 有一个重要注意点:`Disallow` 只阻止抓取,并不能阻止收录。页面被外部网站链接时,Google 有时会不看内容,只把 URL 收进索引。要确实防止收录,请使用 `noindex` 元标签。

`robots.txt` 的设置失误会带来严重影响。若误设 `Disallow: /` 即禁止抓取整个网站,整个网站都会从搜索结果中消失。把预发布环境的 `robots.txt` 原样部署到生产环境的事故,在实务中是常见失误。

短链接服务中,用于重定向的路径即短代码没有必要让爬虫抓取,因此在 `robots.txt` 中设置为 `Disallow` 是恰当的。不过,博客文章和术语集等以 SEO 为目标的页面则需要设为 `Allow`。

分享到 XHatena

这篇文章对您有帮助吗?

相关术语

相关文章

常见问题

用 robots.txt 阻止抓取的页面会被索引吗?
抓取会被阻止,但如果被其他页面链接,URL 可能仍会保留在索引中。要完全从索引中排除,请使用 noindex meta 标签。
robots.txt 配置错误会导致什么问题?
阻止重要页面的抓取会导致其从搜索结果中消失。阻止 CSS 或 JavaScript 也会影响搜索引擎的渲染。

把知识用到真实链接上

免费缩短网址