一句话总结
本清单给出五步可复现的 AI 收录自查方法:检查 robots.txt 是否放行 AI 爬虫、sitemap.xml 是否正常、llms.txt 是否存在、页面 JSON-LD 结构化数据是否齐全、hreflang 与 SSR 是否就绪;全部通过即完成 AI 收录的基础配置。
适用场景
内容站运营者希望被 ChatGPT、Claude、Google AI Overview 等生成式 AI 引用时,需要先确认站点对 AI 爬虫可访问、可解析。本清单适用于任何自有网站,所有检查命令可在 macOS/Linux 终端直接执行。
五步操作清单
第 1 步:确认 robots.txt 放行 AI 爬虫
执行 curl -s https://你的域名/robots.txt,检查是否包含以下常见 AI/搜索爬虫的 Allow 条目:
- GPTBot、ChatGPT-User、OAI-SearchBot(OpenAI)
- ClaudeBot、Claude-SearchBot(Anthropic)
- Google-Extended、Googlebot(Google AI/搜索)
- Bingbot、Microsoft-Copilot(微软)
若未放行,需在 robots.txt 中为上述爬虫添加 User-agent: <名称> 与 Allow: /。
第 2 步:确认 sitemap.xml 可访问且包含文章
执行 curl -s https://你的域名/sitemap.xml,确认返回 XML 且包含文章 URL;每篇文章应同时存在 zh/en/ja 等多语言 alternate 链接。sitemap 是搜索引擎与 AI 爬虫发现内容的入口。
第 3 步:确认 llms.txt 存在
执行 curl -s https://你的域名/llms.txt,确认返回 200 且包含站点说明与文章目录(Markdown 链接列表)。llms.txt 是面向大语言模型的标准文本索引,AI 可直接读取全文内容。
第 4 步:确认文章页有 JSON-LD 结构化数据
抓取任意文章页源码,检查是否存在 application/ld+json 类型的 script 标签,并确认其中的 @type 与内容类型匹配:
- 知识文章用
Article - 新闻用
NewsArticle - 数据页用
Dataset - 问答页用
FAQPage - 对比页可附加
ItemList
结构化数据帮助 AI 理解页面类型并直接引用关键字段(headline、datePublished 等)。
第 5 步:确认 hreflang、canonical 与服务端渲染
抓取页面源码检查:alternate 的 hreflang 链接是否覆盖各语言、canonical 链接是否存在、正文是否直接出现在 HTML 中(非 JavaScript 渲染)。AI 爬虫多数不执行 JS,服务端直出是内容可被解析的前提。
注意事项
- 每步执行前将“你的域名”替换为实际域名;本清单以公开可访问的站点为假设,不适用于需要登录的私有页面。
- 检查结果只代表“技术上可被收录”,不保证 AI 一定引用;内容质量与权威性仍是被引用的核心因素。
- 本清单所有命令均为只读操作,不会修改服务器配置;修改 robots.txt 等文件需在服务器端完成。
