robots.txt 是什么?
robots.txt 是放在网站根目录下的纯文本文件,属于 Robots 排除协议。它用来告诉搜索引擎爬虫哪些目录或页面可以抓取、哪些禁止抓取。注意它是网站与爬虫之间的约定,并非强制性的安全手段,重要内容仍应通过权限或登录保护。
robots.txt 应该放在哪个目录?
必须放在网站根目录,即通过 https://你的域名/robots.txt 可以直接访问。放在子目录(例如 /blog/robots.txt)只对该子目录生效,主流爬虫只会读取根目录的那一份。
robots.txt 和 noindex 有什么区别?
两者控制的目标不同:robots.txt 决定能不能抓取,meta noindex 决定能不能被收录。如果只是不想让某个页面出现在搜索结果里,应使用 noindex 标签;用 robots.txt 屏蔽该页面反而会让爬虫读不到 noindex,可能出现“已屏蔽但仍被收录”的情况。
屏蔽 GPTBot、ClaudeBot 等 AI 爬虫真的有效吗?
对遵守协议的 AI 爬虫有效。使用上方「屏蔽 AI 爬虫」预设,会自动为 GPTBot、ClaudeBot、CCBot、Google-Extended、PerplexityBot 等写入 Disallow: /。但 robots.txt 属于自愿遵守的协议,无法阻止不守规则的采集程序。
Crawl-delay 抓取延迟所有搜索引擎都支持吗?
不是。Crawl-delay 目前主要被 Bing、Yandex 等支持,Google 官方已不支持该指令,建议改用 Search Console 里的抓取速度设置。因此本工具中这一项是可选的,留空不影响最终结果。
修改 robots.txt 后多久生效?
爬虫通常会在下次抓取时重新读取 robots.txt,一般几小时到几天不等。若需加速,可在 Google Search Console 或 Bing 网站管理员工具中提交 robots.txt 并请求重新抓取。