Welke AI-crawlers toestaan in robots.txt om uw site in AI-antwoorden te krijgen in 2026
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
Het artikel onderzoekt het probleem van onzichtbaarheid van websites voor AI-assistenten: vaak blokkeert robots.txt de toegang voor trainings- en realtimebots, terwijl normale indexering wel werkt. Het biedt een lijst met relevante crawlers (GPTBot, PerplexityBot, Google-Extended, enz.), samen met tips voor het configureren van toegang en het controleren van logs.
De auteur beschrijft een typische situatie: een website staat goed geïndexeerd bij Google en Yandex, maar verschijnt niet in ChatGPT-antwoorden omdat robots.txt een Disallow bevat voor GPTBot, ClaudeBot en PerplexityBot. Er zijn twee soorten AI-crawlers: die voor modeltraining (GPTBot, ClaudeBot, CCBot) en realtime-crawlers (OAI-SearchBot, PerplexityBot, ChatGPT-User). Om in AI-antwoorden te verschijnen, moet je toegang toestaan voor bots van de werkende lijst zoals die eind juli 2026 was, waaronder GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended, CCBot. Het wordt aanbevolen om robots.txt elk kwartaal te controleren, omdat er nieuwe user agents verschijnen (zo heeft Google NotebookLM hernoemd naar Google-GeminiNotebook). Robots.txt is slechts de eerste laag; problemen kunnen ontstaan door Content-Security-Policy, gebrek aan SSR (bots kunnen niet zien wat door JS wordt geladen) en oneindig scrollen. Om de toegang te controleren, stelt de auteur grep op logs en curl met User-Agent-spoofing voor. Drie veelgemaakte fouten: verouderde robots.txt, CDN-beveiliging die legitieme bots blokkeert, en valse geruststelling dat indexeren gegarandeerd AI-crawlertoegang geeft. De oplossing in het beschreven geval duurde 15 minuten en leidde snel tot een toename van citaties in ChatGPT en Perplexity.
Bron: Habr — хаб ИИ —
origineel
