AI crawler 测试从一个简单问题开始:
Crawler 是否收到了用户和搜索引擎都需要的重要内容?
答案不一定明显。现代网站可能根据 user agent、设备、cookie 和渲染状态提供不同 HTML、重定向、脚本、懒加载内容、bot 规则和 metadata。
这套流程帮助你在可见性问题变成排名问题前,测试 AI crawler 和搜索 bot 看到的内容。
第一步:选择页面类型
不要只测首页。
从每个重要模板选一个 URL:
- 博客文章
- 产品或功能页
- 文档页
- 价格页
- 分类页
- 工具页
- JavaScript 较重页面
- 多语言页面
对 Fennec 来说,第一批可以包含 AI Overview、Bot Simulator、Schema Markup、Technical SEO 和一篇新博客。
第二步:检查访问规则
渲染前先确认 crawler 访问:
- robots.txt 允许该路径
- meta robots 没有 noindex
- X-Robots-Tag header 没有阻止
- canonical 指向目标 URL
- sitemap 包含 canonical URL
- 多语言页面 hreflang 正确
可以用 robots.txt checker、canonical checker 和 sitemap checker 排除小阻断。
第三步:比较 User Agent
用不同 user agent 抓取页面:
- 普通浏览器
- Googlebot smartphone
- Bingbot
- GPTBot
- OAI-SearchBot
- ChatGPT-User
- ClaudeBot
重点比较:
- HTTP 状态
- 重定向链
- 最终 URL
- HTML 大小
- Title
- Meta description
- Canonical
- 主体内容
- 内部链接
- 结构化数据
Fennec 的 Bot Simulator 就适合做这种对比。
第四步:比较 Raw HTML 与 Rendered DOM
很多 SEO 问题藏在初始 HTML 和渲染页面之间。
检查:
- 主体内容是否在 raw HTML 中?
- 如果不在,渲染后是否出现?
- title 和 meta 是否服务端输出?
- schema 是否由 JavaScript 晚注入?
- 链接是真 anchor 还是 click handler?
- 懒加载是否隐藏关键文本?
- 移动端是否遗漏重要内容?
如果重要内容只在脆弱脚本链之后出现,页面风险更高。
第五步:检查结构化数据
AI 搜索不需要特殊 AI markup,但结构化数据仍有助于搜索系统理解页面类型和实体。
检查:
- 博客使用 Article schema
- 产品或软件页面使用相关 schema
- Organization 和 author 一致
- Breadcrumb schema
- FAQ 只有在真实展示且符合当前指南时使用
用 Schema Markup 验证 JSON-LD,避免过期 rich-result 假设。
第六步:测试内容抽取
假设 crawler 需要总结页面。
它能否抽取:
- 核心答案
- 页面目的
- 作者或组织
- 更新日期
- 下一步链接
- 关键例子或表格
- 相关产品动作
如果人类都很难快速识别这些项目,自动系统也可能困难。
第七步:查看真实日志
模拟有用,但日志显示真实访问。
查看服务器日志:
- User agent
- 时间
- 请求 URL
- 状态码
- 响应大小
- 缓存命中
- 可用时的国家或网络
重点找 crawler 激增、重复 404、重定向循环和大媒体文件请求。
AI Crawler 测试清单
每个 URL 都记录:
| 检查项 | 是否通过 |
|---|---|
| URL 返回 200 | |
| robots 允许访问 | |
| 没有意外 noindex | |
| canonical 正确 | |
| 主体内容在 raw 或 rendered HTML 中可见 | |
| H1 匹配页面主题 | |
| 内部链接可抓取 | |
| 结构化数据有效 | |
| 移动端显示主体内容 | |
| user-agent 响应一致 |
总结
测试 AI crawler 不是猜哪个 bot 最重要,而是验证重要页面在不同 crawler 视图下是否可访问、可理解、且保持一致。
从访问规则开始,比较 user agent,检查 raw 与 rendered 内容,验证 schema,并用日志确认。这套流程能发现趋势文章看不到的问题。