Qué rastreadores de IA permitir en robots.txt para que tu sitio aparezca en las respuestas de IA en 2026
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
El artículo examina el problema de la invisibilidad de los sitios web para los asistentes de IA: a menudo, el archivo robots.txt bloquea el acceso tanto para los bots de entrenamiento como para los bots en tiempo real, aunque el indexado normal funciona correctamente. Proporciona una lista de rastreadores relevantes (GPTBot, PerplexityBot, Google-Extended, entre otros), junto con consejos para configurar el acceso y revisar los registros.
El autor describe una situación típica: un sitio web está bien indexado por Google y Yandex, pero no aparece en las respuestas de ChatGPT porque el archivo robots.txt tiene la directiva "Disallow" para GPTBot, ClaudeBot y PerplexityBot. Existen dos tipos de rastreadores de inteligencia artificial: los que se utilizan para entrenar modelos (GPTBot, ClaudeBot, CCBot) y los que actúan en tiempo real (OAI-SearchBot, PerplexityBot, ChatGPT-User). Para aparecer en las respuestas de la inteligencia artificial, es necesario permitir el acceso a los bots de la lista vigente a finales de julio de 2026, que incluye a GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended y CCBot. Se recomienda revisar el archivo robots.txt trimestralmente, ya que aparecen nuevos agentes de usuario (por ejemplo, Google renombró NotebookLM a Google-GeminiNotebook). El archivo robots.txt es solo la primera capa; pueden surgir problemas con la Política de Seguridad de Contenido, la falta de renderizado del lado del servidor (los bots no pueden ver el contenido cargado mediante JavaScript) y el desplazamiento infinito. Para comprobar el acceso, el autor sugiere buscar en los registros con grep y utilizar curl con suplantación del agente de usuario. Tres errores comunes: un archivo robots.txt desactualizado, la protección de una red de entrega de contenidos que bloquea bots legítimos y la falsa confianza de que la indexación garantiza el acceso de los rastreadores de inteligencia artificial. La solución en el caso descrito llevó 15 minutos y rápidamente aumentó las citas en ChatGPT y Perplexity.
Fuente: Habr — хаб ИИ —
original
