允许哪些 AI 爬虫出现在 robots.txt 中,以便你的网站在 2026 年进入 AI 回答
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
文章探讨了网站对 AI 助手不可见的问题:尽管常规索引正常,但 robots.txt 常常阻止了训练和实时机器人的访问。它提供了相关爬虫列表(GPTBot、PerplexityBot、Google-Extended 等),以及配置访问和检查日志的技巧。
作者描述了一个典型情况:网站被Google和Yandex良好收录,但由于robots.txt中设置了针对GPTBot、ClaudeBot和PerplexityBot的Disallow指令,导致无法出现在ChatGPT的回复中。AI爬虫分为两类:用于模型训练的爬虫(如GPTBot、ClaudeBot、CCBot)和实时爬虫(如OAI-SearchBot、PerplexityBot、ChatGPT-User)。要让网站出现在AI回复中,需要允许截至2026年7月底工作清单中的爬虫访问,包括GPTBot、ChatGPT-User、OAI-SearchBot、ClaudeBot、anthropic-ai、PerplexityBot、Google-Extended、YandexBot/YandexAI、GigaChat、Applebot-Extended、CCBot。建议每季度检查一次robots.txt,因为新的用户代理会出现(例如,Google已将NotebookLM更名为Google-GeminiNotebook)。Robots.txt只是第一层,问题还可能来自内容安全策略(Content-Security-Policy)、缺乏服务端渲染(SSR,爬虫无法看到由JavaScript加载的内容)以及无限滚动。要检查访问权限,作者建议使用grep检查日志,并通过curl伪装用户代理。三个常见错误:过时的robots.txt、CDN防护阻止了合法爬虫,以及错误地认为被索引就能保证AI爬虫访问。所描述案例中的修复只需15分钟,并迅速导致ChatGPT和Perplexity中引用量的增加。
来源: Habr — хаб ИИ —
原文
