Robots.txt 检查工具
获取网站真实的 robots.txt,检查语法、全站拦截、Sitemap 声明,以及搜索与 AI 爬虫的访问策略。
检查一个网站
输入域名或任意页面地址。我们始终检查该站点根目录下的 /robots.txt。
检查由 Fennec 的 Cloudflare API 完成,不会修改目标网站。
正在获取并分析…
AI 爬虫访问概况
根据专属 User-agent 规则优先、通配符规则其次的方式判断。“部分禁止”表示只有部分路径被禁止。
| Crawler | 用途 | 访问状态 | 命中规则 | 路径规则 |
|---|
解析后的规则组
发现的 Sitemap
查看原始 robots.txt
这项检查覆盖什么?
一次检查同时回答文件是否可访问、规则能否被解析,以及不同类型 crawler 会看到什么。
实时获取
显示最终请求地址、HTTP 状态、响应时间、文件大小和内容类型。
语法诊断
识别缺少 User-agent、无效路径、错误 Sitemap URL 和全站拦截。
AI crawler
分别检查搜索、训练与用户触发型 AI crawler 的访问状态。
原始证据
保留并展示实际 robots.txt,方便开发与 SEO 团队复核。
一次检查如何完成
检查流程:输入网站地址后,边缘 API 安全获取 robots.txt,再解析为诊断、Sitemap 与 crawler 访问状态。
- 自动定位站点根目录的 /robots.txt
- 限制重定向、响应时间与文件大小
- 输出规则诊断、Sitemap 和 crawler 权限
常见 robots.txt 规则
规则区分大小写,并且只对当前协议、主机名和端口生效。请把文件放在站点根目录。
允许所有 crawler
空的 Disallow 表示没有路径限制。
User-agent: *
Disallow: 禁止目录
路径必须从 / 开始,大小写敏感。
User-agent: *
Disallow: /admin/
Disallow: /internal-search/ 在禁止目录中开放例外
更具体的 Allow 可以开放需要抓取的资源。
User-agent: *
Disallow: /private/
Allow: /private/public-guide/ 声明 Sitemap
使用完整的绝对 URL,可声明多个 Sitemap。
Sitemap: https://example.com/sitemap.xml 如何管理 AI 爬虫
不要把所有 AI crawler 当成同一种用途。搜索发现、模型训练和用户触发访问通常使用不同的 User-agent。
| User-agent | 提供方 | 用途 | 类型 |
|---|---|---|---|
| OAI-SearchBot | OpenAI | ChatGPT 搜索发现、摘要与引用 | 搜索 |
| GPTBot | OpenAI | 可能用于改进和训练模型的网页收集 | 训练 |
| ChatGPT-User | OpenAI | 用户主动要求 ChatGPT 访问页面 | 用户触发 |
| Claude-SearchBot | Anthropic | 提升 Claude 搜索结果的发现与相关性 | 搜索 |
| ClaudeBot | Anthropic | 可能进入模型训练数据的网页收集 | 训练 |
| Claude-User | Anthropic | Claude 用户发起的网页访问 | 用户触发 |
| PerplexityBot | Perplexity | Perplexity 搜索索引与结果引用 | 搜索 |
| Google-Extended | 控制部分 Gemini 与 Vertex AI 训练/grounding 使用,不影响 Google 搜索收录 | AI 使用 |
注意:OpenAI 表示用户触发的 ChatGPT-User 可能不适用 robots.txt;Perplexity 也说明 Perplexity-User 通常会忽略 robots.txt。工具会把这类访问标记为“规则可能不适用”。
按用途拆分 AI crawler 策略
同一份 robots.txt 可以分别管理搜索发现、模型训练和用户触发型访问,而不是对所有 AI crawler 使用一个开关。
- 保留搜索发现与引用入口
- 单独拒绝模型训练 crawler
- 标记可能不适用 robots.txt 的用户触发访问
常用的“允许搜索、拒绝训练”策略
下面示例保留 ChatGPT 和 Claude 搜索发现,同时拒绝 OpenAI、Anthropic 的训练 crawler。上线前请根据业务和授权策略复核。
# 保留 AI 搜索发现
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# 拒绝模型训练 crawler
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# 其他守规矩 crawler 的默认策略
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Allow: /
Sitemap: https://example.com/sitemap.xml 三层控制,各自解决不同问题
控制层级:robots.txt 表达抓取偏好,CDN/WAF 执行网络拦截,认证和源站权限保护真正的私密内容。
- robots.txt:向守规矩 crawler 表达偏好
- CDN / WAF:执行强制网络拦截
- 认证与权限:保护真正的私密资源
Robots.txt 常见问题
robots.txt 能让页面从 Google 消失吗?
不能保证。robots.txt 控制抓取,不是可靠的移除索引工具。如果 crawler 被禁止访问页面,它也无法读取页面上的 noindex。
没有 robots.txt 会怎样?
通常等同于没有路径抓取限制,但服务器、CDN、WAF、登录和 HTTP 状态仍可能阻止 crawler。建议至少提供一个可访问的基础文件并声明 Sitemap。
Disallow: / 是什么意思?
它通常会禁止对应 User-agent 抓取整个站点。若出现在 User-agent: * 规则组中,可能让所有守规矩的 crawler 无法访问。
可以用 robots.txt 保护隐私内容吗?
不可以。文件本身公开可见,而且恶意 crawler 可以忽略规则。敏感内容必须使用身份验证、权限和网络访问控制。
为什么 robots.txt 允许,但 AI crawler 仍然访问失败?
robots.txt 只是一个控制层。Cloudflare、WAF、Bot Management、限速、验证码、地区规则和源站防火墙都可能另外返回 403 或 429。