`robots.txt` 是放在 Web 网站根目录下、向搜索引擎爬虫指示抓取范围的文本文件。它可通过 `example.com/robots.txt` 访问,依据 Robots Exclusion Protocol (REP)。
`robots.txt` 的基本语法由四项构成:`User-agent` 指定对象爬虫,`Disallow` 指定禁止抓取的路径,`Allow` 指定允许抓取的路径,`Sitemap` 指定站点地图的 URL。`User-agent: *` 以所有爬虫为对象,`User-agent: Googlebot` 只以 Google 的爬虫为对象。
`robots.txt` 有一个重要注意点:`Disallow` 只阻止抓取,并不能阻止收录。页面被外部网站链接时,Google 有时会不看内容,只把 URL 收进索引。要确实防止收录,请使用 `noindex` 元标签。
`robots.txt` 的设置失误会带来严重影响。若误设 `Disallow: /` 即禁止抓取整个网站,整个网站都会从搜索结果中消失。把预发布环境的 `robots.txt` 原样部署到生产环境的事故,在实务中是常见失误。
短链接服务中,用于重定向的路径即短代码没有必要让爬虫抓取,因此在 `robots.txt` 中设置为 `Disallow` 是恰当的。不过,博客文章和术语集等以 SEO 为目标的页面则需要设为 `Allow`。