Crawler AI Mana yang Harus Diizinkan di robots.txt agar Situs Anda Masuk ke Jawaban AI pada 2026
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
Artikel ini mengkaji masalah ketidakjelasan situs web bagi asisten AI: seringkali robots.txt memblokir akses untuk bot pelatihan dan real-time, meskipun pengindeksan biasa berfungsi dengan baik. Artikel ini memberikan daftar crawler yang relevan (GPTBot, PerplexityBot, Google-Extended, dll.), beserta tips untuk mengonfigurasi akses dan memeriksa log.
Penulis menjelaskan situasi yang umum terjadi: sebuah situs web terindeks dengan baik oleh Google dan Yandex, tetapi tidak muncul dalam respons ChatGPT karena robots.txt memiliki Disallow untuk GPTBot, ClaudeBot, dan PerplexityBot. Ada dua jenis perayap AI: yang untuk pelatihan model (GPTBot, ClaudeBot, CCBot) dan yang real-time (OAI-SearchBot, PerplexityBot, ChatGPT-User). Untuk muncul dalam jawaban AI, Anda perlu mengizinkan akses untuk bot dari daftar kerja per akhir Juli 2026, termasuk GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended, CCBot. Disarankan untuk memeriksa robots.txt setiap tiga bulan, karena agen pengguna baru bermunculan (misalnya, Google mengganti nama NotebookLM menjadi Google-GeminiNotebook). Robots.txt hanyalah lapisan pertama; masalah dapat timbul dari Content-Security-Policy, kurangnya SSR (bot tidak dapat melihat konten yang dimuat oleh JS), dan pengguliran tak terbatas. Untuk memeriksa akses, penulis menyarankan grep pada log dan curl dengan penyamaran User-Agent. Tiga kesalahan umum: robots.txt usang, perlindungan CDN yang memblokir bot sah, dan keyakinan palsu bahwa pengindeksan menjamin akses perayap AI. Perbaikan pada kasus yang dijelaskan hanya membutuhkan waktu 15 menit dan dengan cepat menyebabkan peningkatan kutipan di ChatGPT dan Perplexity.
Sumber: Habr — хаб ИИ —
asli
