🎯 为什么重要
robots.txt 挡住 AI 爬虫,大多不是故意的,可能只是装了安全插件,或用了一条笼统的“屏蔽爬虫”规则。但只要读你页面的爬虫进不来,AI 引擎就永远不会引用你。这是成本最低、见效最快的 GEO 动作,而大多数团队从没查过。
💬 我的观点
放 AI 爬虫进来,别把自己挡在 AI 答案外面
很多在 ChatGPT、Perplexity、Google AI 摘要里查不到的网站,问题不在内容,而是爬虫压根没进来过。
你的 robots.txt 里哪些爬虫被挡在门外,AI 能帮你读出来。但它看不到你的线上文件,除非你把文件粘给它或让它联网,所以直接把真东西给它。
最快:一条提示词,端到端
打开 yoursite.com/robots.txt,把整个文件复制下来,粘进 ChatGPT 或 Claude 的这条提示词:
🤖 AI 提示词 — 粘贴到 ChatGPT / Claude
你是一个技术 SEO,正在审查网站 robots.txt 的 AI 爬虫权限。
这是我完整的 robots.txt:
[粘贴整个文件]
2026 年需要关注的 AI 爬虫有:GPTBot、OAI-SearchBot、ChatGPT-User(OpenAI);ClaudeBot、Claude-SearchBot、Claude-User(Anthropic);PerplexityBot、Perplexity-User(Perplexity);Google-Extended(Google 用来拒绝 Gemini 和 AI 训练的控制标记);以及 CCBot、Bytespider、Amazonbot、Applebot-Extended。
请完成以下步骤,只返回一张 markdown 表格:
1. 对上面每一个爬虫,说明我的文件是放行还是屏蔽,并引用决定它的那一行原文。
2. 标出哪些爬虫是被一条通配规则(User-agent: *)误伤的、多半不是本意要挡的。
3. 给出应该新增的确切行,来放行我该放进来的 AI 爬虫。
4. 如果你不确定某个 user-agent 名称是不是最新的,就打开它的官方文档确认,不要自己编 user-agent 名。不能联网的话,说清楚哪些没核实。
列:爬虫 | 放行还是屏蔽 | 决定的那一行 | 建议改动
如果 Googlebot(搜索)在任何地方被挡了,明确警告我。
让 AI 拿各家官方文档核对一遍 user-agent 名称。这些名字会变,一条过期的屏蔽规则比不设还糟。
或者,五步做完
- 拉出你的线上 robots.txt,地址 yoursite.com/robots.txt。换主机、装安全插件、上 CDN 都会悄悄改写它,不会通知你。
- 给每个 AI 爬虫定放行还是屏蔽。 除非有特别理由,放行 GPTBot、OAI-SearchBot、ChatGPT-User、PerplexityBot、Perplexity-User、ClaudeBot、Claude-SearchBot、Claude-User 和 Google-Extended。
- 千万别把 Google-Extended 和 Googlebot 搞混。 Google-Extended 只是拒绝 Gemini 和 AI 训练,Googlebot 是常规搜索。挡错对象,要么白挡,要么直接丢掉搜索流量。
- 改完重新部署。 Shopify 改 robots.txt.liquid;WordPress 要去看 SEO 插件的爬虫设置,而不只是原始文件。
- 用 curl 复验。 运行
curl -A "GPTBot" https://yoursite.com/your-page,读返回的原始 HTML。你在意的内容不在里面,AI 引擎也看不到,因为这些爬虫不跑 JavaScript。
为什么先用 AI: 模型读一份 robots.txt,几秒就能把每个爬虫标成放行或屏蔽。它唯一的弱点是 user-agent 名会用到过期的,所以让它拿官方文档核对名字。
挡爬虫的代价,还有两个坑
- 2026 年对 120 多个知名网站的检查发现,近 45% 至少挡住了一个主流 AI 爬虫,被挡最多的是 GPTBot、CCBot、ClaudeBot,多半是通用防采集规则误伤的。
- 这些爬虫不执行 JavaScript。 GPTBot 和 ClaudeBot 偶尔抓 JS 文件,但从不运行。靠前端渲染的内容在它们眼里就是个空壳。想被引用,用服务端渲染或静态生成。
- llms.txt 是锦上添花,不是解药。 谷歌明确说过不用它,也没有哪家主流引擎保证会读。等权限和内容都做好了,顺手加一个,但别把它当解法。
旧的标记 anthropic-ai 和 claude-web 已经废弃,针对它们写的规则对现在的 Claude 流量毫无作用。
每次换插件、CDN 或主机后都重查一遍。
⚖️ 该做 & 别做
该做
- 在robots.txt里明确放行GPTBot、OAI-SearchBot、ChatGPT-User、PerplexityBot、Perplexity-User、ClaudeBot、Claude-User、Claude-SearchBot和Google-Extended,除非有特别理由要挡某一个。
- 凡是想被AI引用的页面,都要给出完整渲染后的HTML(服务端渲染或静态生成),这些爬虫不执行JavaScript。
- 每次换安全插件、CDN或主机后,都重新查一下robots.txt,通用的“屏蔽爬虫”预设经常会误伤AI爬虫。
- 内容和爬虫权限都做好之后,顺手上一个简单的llms.txt,成本很低,不会有坏处。
避免
- 别用一条针对采集机器人的“全部屏蔽”规则,那会把GPTBot、PerplexityBot、ClaudeBot一起挡在外面。
- 别把Google-Extended(只拒绝Gemini和AI训练)和Googlebot(拒绝整个搜索收录)搞混,挡错对象要么白挡,要么直接丢掉搜索流量。
- 别以为robots.txt是一把锁,它只是一个请求,已经有爬虫被发现无视它,或伪装成浏览器访问,权限真的重要时要配合服务器层规则。
- 别把llms.txt当成能被爬取的替代品,目前没有哪家主流AI引擎保证会读这个文件。
💡 快速提示
- 快速自测:运行`curl -A "GPTBot" https://yoursite.com/your-page`,看返回的原始HTML里有没有你在意的内容,没有的话,AI引擎也看不到。
- 现在就去看一眼yoursite.com/robots.txt,免费主机和安全插件的默认设置说改就改,不会通知你。
🏢 品牌聚焦
品牌先挡住GPTBot,几个月后又放开,正好赶上和OpenAI签约
Prosus / TechCrunch · 为什么选它:Stack Overflow在2023到2024年的robots.txt变化很有代表性,先挡住GPTBot,几个月后又悄悄放开,时间点几乎正好卡在它和谷歌Gemini、OpenAI签授权合同前后。这是少见的、爬虫权限决定本身就是一笔生意的真实案例。做得好的地方:它没有把爬虫权限白白让出去,而是换成了真金白银的授权收入,母公司Prosus后来也说业务还在增长。要注意的地方:放开爬虫并没有解决根本问题,到2025年底,网站每月新增问题数同比跌了七成多,开发者遇到问题直接问AI,不再来提问了,社区里的版主也因为这些AI合作闹过风波。放AI爬虫进来能让你出现在答案里,但不代表大家还需要你的网站本身。
🏷️ 标签
geoai-searchcrawlers
🔗 相关内容