2026년 AI 답변에 내 사이트를 노출시키기 위해 robots.txt에서 허용해야 할 AI 크롤러
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
이 기사는 AI 어시스턴트에게 웹사이트가 보이지 않는 문제를 분석합니다. 종종 robots.txt가 일반 인덱싱은 정상 작동하지만, 훈련 및 실시간 봇에 대한 접근을 차단합니다. GPTBot, PerplexityBot, Google-Extended 등 관련 크롤러 목록과 함께 접근 구성 및 로그 확인 팁을 제공합니다.
저자는 일반적인 상황을 설명합니다. 어떤 웹사이트가 Google과 Yandex에는 잘 색인되지만, robots.txt에 GPTBot, ClaudeBot, PerplexityBot에 대한 차단(Disallow)이 설정되어 있어 ChatGPT 응답에는 나타나지 않는다는 것입니다. AI 크롤러에는 모델 훈련용(GPTBot, ClaudeBot, CCBot)과 실시간 처리용(OAI-SearchBot, PerplexityBot, ChatGPT-User) 두 가지 유형이 있습니다. AI 답변에 노출되려면 2026년 7월 말 기준 작업 목록의 봇들에 대한 접근을 허용해야 합니다. 여기에는 GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended, CCBot이 포함됩니다. 새로운 사용자 에이전트가 등장하므로(예: Google이 NotebookLM을 Google-GeminiNotebook으로 이름 변경) 분기마다 robots.txt를 확인하는 것이 좋습니다. robots.txt는 첫 번째 계층일 뿐이며, Content-Security-Policy, SSR 부재(봇이 자바스크립트로 로드된 콘텐츠를 볼 수 없음), 무한 스크롤로 인해 문제가 발생할 수 있습니다. 접근 여부를 확인하려면 저자는 로그에서 grep을 사용하고 User-Agent를 스푸핑하여 curl을 실행할 것을 제안합니다. 세 가지 흔한 실수는 오래된 robots.txt, 합법적인 봇을 차단하는 CDN 보호, 그리고 색인 보장이 AI 크롤러 접근을 보장한다는 잘못된 자신감입니다. 설명된 사례의 수정은 15분이 걸렸고, 곧 ChatGPT와 Perplexity에서 인용 횟수가 증가했습니다.
출처: Habr — хаб ИИ —
원문
