屏蔽 GPTBot 不是立场表态,而是运营决策。
常见错误是把所有 AI crawler 都当成同一种东西。OpenAI 文档里区分了不同 bot 和 agent user agent,它们代表的使用场景并不一样。用于模型改进的 crawler、搜索发现 crawler、用户触发的页面抓取,是三类不同问题。
这篇文章给 SEO、法务、产品和技术团队一套框架,用来判断是否允许、收窄、限流或屏蔽 GPTBot,同时避免误伤其他有价值的发现路径。
建议先完成 AI crawler 服务器日志分析,再做策略调整。日志告诉你实际发生了什么,策略决定下一步应该怎样处理。
先问真正的问题
不要先问:
“AI crawler 到底好不好?”
更好的问题是:
“对这个网站、这个内容类型、这个商业模式来说,GPTBot 应该获得什么访问权限?”
这样问题才足够具体。
不同站点区域可能需要不同答案:
| 内容区域 | 应该问的问题 |
|---|---|
| 公开教育博客 | 为了品牌可见性和 AI 理解,开放访问是否可接受? |
| 产品文档 | 是否希望 AI 系统获取准确的产品信息? |
| 价格与商业页 | 页面是否公开、可索引,并适合被总结? |
| 用户生成内容 | 权益、审核或隐私风险是否需要限制? |
| 付费研究或授权数据 | 访问是否冲突商业价值或授权条款? |
| 站内搜索与参数页 | 无论 crawler 类型如何,是否都应该阻止抓取? |
全站一个答案很简单,但按目录制定策略通常更稳。
把 GPTBot 和其他 OpenAI User Agent 分开
写规则前,先区分 crawler 功能。
OpenAI 的 bot 文档区分了 GPTBot、OAI-SearchBot 和 ChatGPT-User 等 user agent。命名、用途和建议可能变化,所以实际写规则前应看官方文档。
OpenAI 当前说明 GPTBot 和 OAI-SearchBot 可以独立控制:publisher 可以通过 GPTBot 拒绝训练用途,同时继续允许 OAI-SearchBot 用于 ChatGPT 搜索。ChatGPT-User 属于用户触发访问,不是自动网页 crawler,因此 robots.txt 规则可能不适用于这类请求。
可以先用这个工作模型:
| User agent 类型 | 策略视角 |
|---|---|
GPTBot | 内容使用和模型改进策略 |
OAI-SearchBot | 搜索发现和可见性策略 |
ChatGPT-User | 用户触发访问和产品体验策略 |
不要因为做了 GPTBot 决策,就把所有 OpenAI 相关 agent 一起屏蔽。
对于 AI 搜索可见性,crawler 权限只是一层。还要结合 GSC Management、Bot Simulator、Robots.txt Checker 和 AI 搜索可见性评分卡。
五个决策输入
改 robots.txt 前,先按站点区域评估五个输入。
| 输入 | 倾向允许 | 倾向限制 |
|---|---|---|
| 内容权益 | 内容由你拥有,并希望被机器正确理解 | 授权、转载、付费或权益敏感内容 |
| 商业价值 | 可见性和准确摘要有助于需求增长 | 内容主要依赖独占访问变现 |
| 抓取成本 | 请求少、命中缓存、主要抓 canonical 页面 | 高流量、突发抓取、重复路径或错误多 |
| 品牌风险 | 内容当前、准确、可归因 | 内容过期、敏感或容易被误读 |
| 衡量能力 | 可以看日志和后续影响 | 看不到 bot 活动或影响 |
如果你看不到 crawler 行为,先补日志,再改策略。
决策表
用这张表确定第一版策略:
| 场景 | 建议动作 |
|---|---|
| 公开、值得引用、抓取成本低的内容 | 允许 GPTBot,并持续监控 |
| 内容有价值,但参数页或薄页面噪音多 | 允许 canonical 区域,屏蔽低价值路径 |
| 大量抓取资产、站内搜索或重复 URL | 屏蔽这些路径,或在边缘层限流 |
| 授权、付费、私密或权益敏感内容 | 对这些区域屏蔽 GPTBot |
| 没有日志可见性,也没有明确业务收益 | 先保守处理,等日志能力完善后复盘 |
最好的策略不一定是 Disallow: /,很多时候是更窄的路径规则。
Robots.txt 示例
允许 GPTBot 访问公开内容,但屏蔽站内搜索和私有路径:
User-agent: GPTBot
Disallow: /search/
Disallow: /account/
Disallow: /admin/
全站屏蔽 GPTBot:
User-agent: GPTBot
Disallow: /
把搜索导向和用户触发 agent 分开:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
只有当这些规则符合你的真实策略时才使用,不要照抄。
编辑后,用 Robots.txt Checker 验证语法,并观察一周服务器日志。
什么时候适合允许 GPTBot
这些情况通常可以考虑允许:
- 内容公开且由你拥有
- 页面准确解释你的产品、品牌或主题
- 你希望 AI 系统学习正确的实体信息
- 抓取成本低
- 可以监控访问情况
- 页面本身已经可索引且对搜索用户有价值
这类内容包括文档、术语表、产品说明和教育型博客。
允许访问并不等于内容自然有价值。GPTBot 权限不能拯救薄内容。仍然要跑 Technical SEO,用 Canonical Checker 验证规范 URL,并让页面来源价值更清晰。
什么时候适合屏蔽 GPTBot
这些情况通常可以考虑屏蔽:
- 内容是授权、转载或受合同限制的
- 付费墙或订阅模式依赖有限访问
- 用户生成内容带来权益或审核风险
- 内容过期,可能误导品牌理解
- 抓取带来可衡量的基础设施成本
- 法务或合规要求限制访问
这不是反 SEO,而是内容治理。
如果屏蔽,要记录原因。后续团队需要知道规则来自权益、成本、品牌风险,还是不确定性。
更好的中间路线:收窄访问
很多网站不需要二选一。
可以先按路径控制:
| 路径类型 | 常见规则 |
|---|---|
| canonical 博客和文档 | 如果公开且有价值,可以允许 |
| 站内搜索 | 屏蔽 |
| account、checkout、admin | 屏蔽 |
| 参数繁重列表页 | 屏蔽或 canonical 化 |
| PDF 和大型媒体 | 按抓取成本和授权判断 |
| 已弃用内容 | 清理、重定向或屏蔽 |
这通常比全站规则更成熟。
部署后一周复查
规则上线后一周,复查:
- 真实 GPTBot 流量是否变化?
4xx或5xx是否减少?- 低价值路径的抓取 bytes 是否下降?
- 重要公开页面是否仍然对目标 crawler 可访问?
- 是否有团队反馈 AI 搜索或助手访问异常?
用 服务器日志工作流 里的同一组字段做前后对比。
Fennec 工作流
可以按这个顺序做第一轮:
- 用 Robots.txt Checker 检查当前策略
- 用 Bot Simulator 测试关键页面
- 用 Canonical Checker 和 Sitemap Checker 复查规范 URL 与 sitemap
- 用 AI 搜索可见性评分卡 给页面打分
- 策略变更后复查日志
目标不是在 AI crawler 争论里站队,而是让策略匹配内容权益、商业模式、抓取成本和搜索目标。
来源
- OpenAI: Crawlers documentation
- Google Search Central: robots.txt introduction
- Google Search Central: AI optimization guide
- Cloudflare: AI Crawl Control
问答
屏蔽 GPTBot 是 SEO 排名因素吗?
不是。GPTBot 策略更像内容使用、访问控制和基础设施决策,不应期待一条 robots.txt 规则直接提升 Google 排名。
GPTBot 和 OAI-SearchBot、ChatGPT-User 是一回事吗?
不是。OpenAI 文档区分了不同用途的 crawler 和 agent user agent,写规则前应先查官方文档。
所有网站都应该屏蔽 GPTBot 吗?
不是。有些网站适合允许,有些适合收窄路径,有些适合屏蔽。答案取决于内容权益、商业模式、抓取成本和品牌风险。
规则应该在哪里测试?
先验证 robots.txt 语法,部署后看服务器日志,再用 crawler 和 bot 模拟工具复查关键页面。