当搜索引擎的爬虫访问你的网站时,首先查看的文件往往是 robots.txt。这个位于网站根目录的纯文本文件,如同一份对爬虫的访客守则,直接决定了搜索引擎如何抓取你的内容,并影响网站的收录与流量分配。
正确配置 robots.txt,不仅可以引导爬虫更高效地索引核心页面,还能屏蔽对后台、私密目录的访问,避免资源被无意义消耗。不过,任何设置错误也可能带来灾难性后果。
robots.txt 采用 RFC 标准规定的语法,仅包含两条核心指令:User-agent 和 Disallow。具体规则如下:
注意:文件必须命名为 robots.txt,放置于网站根目录(如 https://example.com/robots.txt)。每一行指令必须以 User-agent 开头,且规则按顺序匹配,优先级取决于爬虫实现。
很多站长在初次设置时容易踩坑,以下列举最常见的几类问题:
遇到问题时,建议用浏览器访问 https://域名/robots.txt 验证文件是否存在。同时可以使用 Google Search Console 中的 robots.txt 测试工具,检查是否屏蔽了重要页面的入口。
编写时应根据你的站点类型和网站结构灵活制定规则。以下是针对企业网站的典型示例:
注意事项:不要用 robots.txt 来防止他人下载内容——它只是爬虫协议,不代表强制安全机制。真正敏感的数据仍需使用身份验证或 .htaccess 等服务器端策略。
上线后定期检查 robots.txt 文件,确保没有因为网站结构调整而遗漏关键目录的屏蔽。推荐以下方法:
即便所有规则看起来正确,也建议每隔三个月复核一次。特别是更换模板、升级 CMS 后,之前的规则可能不再适用。
通常情况下,搜索引擎的爬虫会在下一次抓取时立即读取更新后的 robots.txt 文件。但部分深度缓存的旧规则可能在 24 小时内依然生效。修改后可通过 Search Console 提交请求强制刷新。
对于同一爬虫,Allow 指令的优先级高于 Disallow。例如先设置 Disallow: /,然后 Allow: /public/,最终公开目录仍可被爬取。多数爬虫按 URL 前缀最长匹配的原则处理。
不能。robots.txt 仅仅是规范,善意遵守的爬虫(如百度、Google)会尊重,但恶意采集器或非浏览器程序会无视规则。如需更安全的防护,应使用 IP 黑名单或验证机制。
robots.txt 是网站 SEO 的基础配置工具,通过合理设置指令可以提升爬虫效率并保护敏感内容。操作要点包括正确放置文件、避免屏蔽整个站点、定期测试规则。建议初学者从最简单的配置开始,逐步优化,同时配合其他安全措施处理高敏感路径。持续关注抓取数据,你的网站会更健康地获得精准流量。