Welche KI-Crawler in robots.txt erlaubt werden sollten, damit Ihre Website 2026 in KI-Antworten erscheint
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
Der Artikel untersucht das Problem der Unsichtbarkeit von Websites gegenüber KI-Assistenten: Oft blockiert robots.txt den Zugriff für Trainings- und Echtzeit-Bots, obwohl das reguläre Indexieren einwandfrei funktioniert. Er listet relevante Crawler auf (GPTBot, PerplexityBot, Google-Extended usw.) sowie Tipps zur Konfiguration des Zugriffs und zur Überprüfung der Logs.
Der Autor beschreibt eine typische Situation: eine Website ist von Google und Yandex gut indexiert, taucht aber nicht in ChatGPT-Antworten auf, weil robots.txt ein Disallow für GPTBot, ClaudeBot und PerplexityBot enthält. Es gibt zwei Arten von KI-Crawlern: solche für das Modelltraining (GPTBot, ClaudeBot, CCBot) und Echtzeit-Crawler (OAI-SearchBot, PerplexityBot, ChatGPT-User). Um in KI-Antworten aufzutauchen, müssen Sie Bots aus der Arbeitsliste vom Ende Juli 2026 Zugriff gewähren, darunter GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended und CCBot. Es wird empfohlen, robots.txt vierteljährlich zu überprüfen, da neue User Agents auftauchen (z.B. hat Google NotebookLM in Google-GeminiNotebook umbenannt). Robots.txt ist nur die erste Ebene; Probleme können auch durch Content-Security-Policy, fehlendes SSR (Bots können per JS geladene Inhalte nicht sehen) und unendliches Scrollen entstehen. Um den Zugriff zu prüfen, schlägt der Autor grep auf Logs und curl mit User-Agent-Spoofing vor. Drei häufige Fehler: veraltetes robots.txt, CDN-Schutz, der legitime Bots blockiert, und die trügerische Sicherheit, dass Indexierung den Zugriff von KI-Crawlern garantiert. Der Fix im beschriebenen Fall dauerte 15 Minuten und führte schnell zu einer Zunahme von Zitaten in ChatGPT und Perplexity.
Quelle: Habr — хаб ИИ —
Original
