Quais rastreadores de IA permitir no robots.txt para colocar seu site nas respostas de IA em 2026
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
O artigo examina o problema da invisibilidade de sites para assistentes de IA: muitas vezes o robots.txt bloqueia o acesso para bots de treinamento e em tempo real, mesmo que a indexação regular funcione bem. Ele fornece uma lista de rastreadores relevantes (GPTBot, PerplexityBot, Google-Extended, entre outros), juntamente com dicas para configurar o acesso e verificar logs.
O autor descreve uma situação típica: um site está bem indexado pelo Google e Yandex, mas não aparece nas respostas do ChatGPT porque o robots.txt tem Disallow para GPTBot, ClaudeBot e PerplexityBot. Existem dois tipos de rastreadores de IA: os de treinamento de modelo (GPTBot, ClaudeBot, CCBot) e os de tempo real (OAI-SearchBot, PerplexityBot, ChatGPT-User). Para aparecer nas respostas de IA, é necessário permitir o acesso para os bots da lista de trabalho do final de julho de 2026, incluindo GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended, CCBot. Recomenda-se verificar o robots.txt trimestralmente, pois novos user agents surgem (por exemplo, o Google renomeou NotebookLM para Google-GeminiNotebook). O robots.txt é apenas a primeira camada; podem surgir problemas com Content-Security-Policy, falta de SSR (bots não conseguem ver conteúdo carregado por JS) e rolagem infinita. Para verificar o acesso, o autor sugere grep nos logs e curl com spoofing de User-Agent. Três erros comuns: robots.txt desatualizado, proteção de CDN bloqueando bots legítimos e falsa confiança de que a indexação garante acesso de rastreadores de IA. A correção no caso descrito levou 15 minutos e rapidamente resultou em aumento de citações no ChatGPT e no Perplexity.
Fonte: Habr — хаб ИИ —
original
