Mitkä AI-indeksointirobotit robots.txt:ään sallitaan, jotta sivusto pääsee AI-vastauksiin vuonna 2026
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
Artikkelissa tarkastellaan verkkosivustojen näkymättömyysongelmaa tekoälyavustajille: usein robots.txt estää pääsyn sekä koulutus- että reaaliaikaisilta boteilta, vaikka tavallinen indeksointi toimii hyvin. Siinä luetellaan olennaiset indeksointirobotit (GPTBot, PerplexityBot, Google-Extended jne.) sekä vinkkejä pääsyn määrittämiseen ja lokien tarkistamiseen.
Kirjoittaja kuvailee tyypillistä tilannetta: verkkosivusto on hyvin indeksoitu Googleen ja Yandexiin, mutta se ei näy ChatGPT:n vastauksissa, koska robots.txt-tiedostossa on kielto (Disallow) GPTBotille, ClaudeBotille ja PerplexityBotille. On olemassa kahdenlaisia tekoälyrobotteja: mallien koulutukseen tarkoitettuja (GPTBot, ClaudeBot, CCBot) ja reaaliaikaisia (OAI-SearchBot, PerplexityBot, ChatGPT-User). Jotta sivusto näkyisi tekoälyvastauksissa, on sallittava pääsy heinäkuun 2026 lopun työlistan roboteille, mukaan lukien GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended, CCBot. robots.txt on suositeltavaa tarkistaa neljännesvuosittain, koska uusia käyttäjäagentteja ilmestyy (esimerkiksi Google nimesi NotebookLM:n uudelleen Google-GeminiNotebookiksi). robots.txt on vasta ensimmäinen kerros; ongelmia voi aiheuttaa Content-Security-Policy, SSR:n puute (botit eivät näe JavaScriptillä ladattua sisältöä) ja loputon rullaus (infinite scrolling). Pääsyn tarkistamiseksi kirjoittaja ehdottaa grep-komentoa lokitiedostoille ja curl-komentoa User-Agentin väärentämisellä. Kolme yleistä virhettä: vanhentunut robots.txt, CDN-suojaus, joka estää lailliset botit, ja väärä luulo, että indeksointi takaa tekoälyrobottien pääsyn. Korjaus kuvatussa tapauksessa kesti 15 minuuttia ja johti nopeasti viittausten lisääntymiseen ChatGPT:ssä ja Perplexityssä.
Lähde: Habr — хаб ИИ —
Alkuperäinen
