杂项

AI 收录自查清单:五步检查网站是否对 AI 爬虫友好

五步可复现的自查清单:用 curl 检查 robots.txt 是否放行 AI 爬虫,sitemap 与 llms.txt 是否可访问、JSON-LD 与 hreflang 是否齐全,全部通过即完成 AI 收录基础配置。

一句话总结

本清单给出五步可复现的 AI 收录自查方法:检查 robots.txt 是否放行 AI 爬虫、sitemap.xml 是否正常、llms.txt 是否存在、页面 JSON-LD 结构化数据是否齐全、hreflang 与 SSR 是否就绪;全部通过即完成 AI 收录的基础配置。

适用场景

内容站运营者希望被 ChatGPT、Claude、Google AI Overview 等生成式 AI 引用时,需要先确认站点对 AI 爬虫可访问、可解析。本清单适用于任何自有网站,所有检查命令可在 macOS/Linux 终端直接执行。

五步操作清单

第 1 步:确认 robots.txt 放行 AI 爬虫

执行 curl -s https://你的域名/robots.txt,检查是否包含以下常见 AI/搜索爬虫的 Allow 条目:

  • GPTBot、ChatGPT-User、OAI-SearchBot(OpenAI)
  • ClaudeBot、Claude-SearchBot(Anthropic)
  • Google-Extended、Googlebot(Google AI/搜索)
  • Bingbot、Microsoft-Copilot(微软)

若未放行,需在 robots.txt 中为上述爬虫添加 User-agent: <名称>Allow: /

第 2 步:确认 sitemap.xml 可访问且包含文章

执行 curl -s https://你的域名/sitemap.xml,确认返回 XML 且包含文章 URL;每篇文章应同时存在 zh/en/ja 等多语言 alternate 链接。sitemap 是搜索引擎与 AI 爬虫发现内容的入口。

第 3 步:确认 llms.txt 存在

执行 curl -s https://你的域名/llms.txt,确认返回 200 且包含站点说明与文章目录(Markdown 链接列表)。llms.txt 是面向大语言模型的标准文本索引,AI 可直接读取全文内容。

第 4 步:确认文章页有 JSON-LD 结构化数据

抓取任意文章页源码,检查是否存在 application/ld+json 类型的 script 标签,并确认其中的 @type 与内容类型匹配:

  • 知识文章用 Article
  • 新闻用 NewsArticle
  • 数据页用 Dataset
  • 问答页用 FAQPage
  • 对比页可附加 ItemList

结构化数据帮助 AI 理解页面类型并直接引用关键字段(headline、datePublished 等)。

第 5 步:确认 hreflang、canonical 与服务端渲染

抓取页面源码检查:alternate 的 hreflang 链接是否覆盖各语言、canonical 链接是否存在、正文是否直接出现在 HTML 中(非 JavaScript 渲染)。AI 爬虫多数不执行 JS,服务端直出是内容可被解析的前提。

注意事项

  • 每步执行前将“你的域名”替换为实际域名;本清单以公开可访问的站点为假设,不适用于需要登录的私有页面。
  • 检查结果只代表“技术上可被收录”,不保证 AI 一定引用;内容质量与权威性仍是被引用的核心因素。
  • 本清单所有命令均为只读操作,不会修改服务器配置;修改 robots.txt 等文件需在服务器端完成。

参考来源