免费技术 SEO 工具

Robots.txt 检查工具

获取网站真实的 robots.txt,检查语法、全站拦截、Sitemap 声明,以及搜索与 AI 爬虫的访问策略。

检查一个网站

输入域名或任意页面地址。我们始终检查该站点根目录下的 /robots.txt。

检查由 Fennec 的 Cloudflare API 完成,不会修改目标网站。

这项检查覆盖什么?

一次检查同时回答文件是否可访问、规则能否被解析,以及不同类型 crawler 会看到什么。

实时获取

显示最终请求地址、HTTP 状态、响应时间、文件大小和内容类型。

语法诊断

识别缺少 User-agent、无效路径、错误 Sitemap URL 和全站拦截。

AI

AI crawler

分别检查搜索、训练与用户触发型 AI crawler 的访问状态。

</>

原始证据

保留并展示实际 robots.txt,方便开发与 SEO 团队复核。

从网站地址经过 Cloudflare API 获取 robots.txt,再生成诊断、Sitemap 和 crawler 访问结果的流程图

一次检查如何完成

检查流程:输入网站地址后,边缘 API 安全获取 robots.txt,再解析为诊断、Sitemap 与 crawler 访问状态。

  • 自动定位站点根目录的 /robots.txt
  • 限制重定向、响应时间与文件大小
  • 输出规则诊断、Sitemap 和 crawler 权限

常见 robots.txt 规则

规则区分大小写,并且只对当前协议、主机名和端口生效。请把文件放在站点根目录。

允许所有 crawler

空的 Disallow 表示没有路径限制。

User-agent: *
Disallow:

禁止目录

路径必须从 / 开始,大小写敏感。

User-agent: *
Disallow: /admin/
Disallow: /internal-search/

在禁止目录中开放例外

更具体的 Allow 可以开放需要抓取的资源。

User-agent: *
Disallow: /private/
Allow: /private/public-guide/

声明 Sitemap

使用完整的绝对 URL,可声明多个 Sitemap。

Sitemap: https://example.com/sitemap.xml

如何管理 AI 爬虫

不要把所有 AI crawler 当成同一种用途。搜索发现、模型训练和用户触发访问通常使用不同的 User-agent。

User-agent提供方用途类型
OAI-SearchBotOpenAIChatGPT 搜索发现、摘要与引用搜索
GPTBotOpenAI可能用于改进和训练模型的网页收集训练
ChatGPT-UserOpenAI用户主动要求 ChatGPT 访问页面用户触发
Claude-SearchBotAnthropic提升 Claude 搜索结果的发现与相关性搜索
ClaudeBotAnthropic可能进入模型训练数据的网页收集训练
Claude-UserAnthropicClaude 用户发起的网页访问用户触发
PerplexityBotPerplexityPerplexity 搜索索引与结果引用搜索
Google-ExtendedGoogle控制部分 Gemini 与 Vertex AI 训练/grounding 使用,不影响 Google 搜索收录AI 使用

注意:OpenAI 表示用户触发的 ChatGPT-User 可能不适用 robots.txt;Perplexity 也说明 Perplexity-User 通常会忽略 robots.txt。工具会把这类访问标记为“规则可能不适用”。

robots.txt 策略把 AI crawler 分为搜索、模型训练和用户触发访问三类的分流图

按用途拆分 AI crawler 策略

同一份 robots.txt 可以分别管理搜索发现、模型训练和用户触发型访问,而不是对所有 AI crawler 使用一个开关。

  • 保留搜索发现与引用入口
  • 单独拒绝模型训练 crawler
  • 标记可能不适用 robots.txt 的用户触发访问

常用的“允许搜索、拒绝训练”策略

下面示例保留 ChatGPT 和 Claude 搜索发现,同时拒绝 OpenAI、Anthropic 的训练 crawler。上线前请根据业务和授权策略复核。

# 保留 AI 搜索发现
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

# 拒绝模型训练 crawler
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

# 其他守规矩 crawler 的默认策略
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Allow: /

Sitemap: https://example.com/sitemap.xml
robots.txt 指令、CDN 与 WAF 强制控制、认证和私密源站组成的三层 crawler 控制架构图

三层控制,各自解决不同问题

控制层级:robots.txt 表达抓取偏好,CDN/WAF 执行网络拦截,认证和源站权限保护真正的私密内容。

  • robots.txt:向守规矩 crawler 表达偏好
  • CDN / WAF:执行强制网络拦截
  • 认证与权限:保护真正的私密资源

Robots.txt 常见问题

robots.txt 能让页面从 Google 消失吗?

不能保证。robots.txt 控制抓取,不是可靠的移除索引工具。如果 crawler 被禁止访问页面,它也无法读取页面上的 noindex。

没有 robots.txt 会怎样?

通常等同于没有路径抓取限制,但服务器、CDN、WAF、登录和 HTTP 状态仍可能阻止 crawler。建议至少提供一个可访问的基础文件并声明 Sitemap。

Disallow: / 是什么意思?

它通常会禁止对应 User-agent 抓取整个站点。若出现在 User-agent: * 规则组中,可能让所有守规矩的 crawler 无法访问。

可以用 robots.txt 保护隐私内容吗?

不可以。文件本身公开可见,而且恶意 crawler 可以忽略规则。敏感内容必须使用身份验证、权限和网络访问控制。

为什么 robots.txt 允许,但 AI crawler 仍然访问失败?

robots.txt 只是一个控制层。Cloudflare、WAF、Bot Management、限速、验证码、地区规则和源站防火墙都可能另外返回 403 或 429。

官方参考资料

Privacy & Cookies

We use cookies to enhance your experience. By continuing to visit this site you agree to our use of cookies.

Fennec Fox