Aplicaciones 🇷🇺 27.07.2026 00:01

Qué rastreadores de IA permitir en robots.txt para que tu sitio aparezca en las respuestas de IA en 2026

OpenAIOpenAI AnthropicAnthropic Perplexity AIPerplexity AI Google/DeepMindGoogle/DeepMind ЯндексЯндекс СберСбер AppleApple Common CrawlCommon Crawl
El artículo examina el problema de la invisibilidad de los sitios web para los asistentes de IA: a menudo, el archivo robots.txt bloquea el acceso tanto para los bots de entrenamiento como para los bots en tiempo real, aunque el indexado normal funciona correctamente. Proporciona una lista de rastreadores relevantes (GPTBot, PerplexityBot, Google-Extended, entre otros), junto con consejos para configurar el acceso y revisar los registros.
El autor describe una situación típica: un sitio web está bien indexado por Google y Yandex, pero no aparece en las respuestas de ChatGPT porque el archivo robots.txt tiene la directiva "Disallow" para GPTBot, ClaudeBot y PerplexityBot. Existen dos tipos de rastreadores de inteligencia artificial: los que se utilizan para entrenar modelos (GPTBot, ClaudeBot, CCBot) y los que actúan en tiempo real (OAI-SearchBot, PerplexityBot, ChatGPT-User). Para aparecer en las respuestas de la inteligencia artificial, es necesario permitir el acceso a los bots de la lista vigente a finales de julio de 2026, que incluye a GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended y CCBot. Se recomienda revisar el archivo robots.txt trimestralmente, ya que aparecen nuevos agentes de usuario (por ejemplo, Google renombró NotebookLM a Google-GeminiNotebook). El archivo robots.txt es solo la primera capa; pueden surgir problemas con la Política de Seguridad de Contenido, la falta de renderizado del lado del servidor (los bots no pueden ver el contenido cargado mediante JavaScript) y el desplazamiento infinito. Para comprobar el acceso, el autor sugiere buscar en los registros con grep y utilizar curl con suplantación del agente de usuario. Tres errores comunes: un archivo robots.txt desactualizado, la protección de una red de entrega de contenidos que bloquea bots legítimos y la falsa confianza de que la indexación garantiza el acceso de los rastreadores de inteligencia artificial. La solución en el caso descrito llevó 15 minutos y rápidamente aumentó las citas en ChatGPT y Perplexity.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas