रोबोट्स.टेक्स्ट में किन AI क्रॉलर्स को अनुमति दें ताकि 2026 में आपकी साइट AI उत्तरों में शामिल हो
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
यह लेख वेबसाइटों की AI सहायकों के लिए अदृश्यता की समस्या की जांच करता है: अक्सर robots.txt प्रशिक्षण और रीयल-टाइम बॉट्स के लिए पहुंच को ब्लॉक कर देता है, भले ही सामान्य इंडेक्सिंग ठीक काम कर रही हो। यह प्रासंगिक क्रॉलर्स (GPTBot, PerplexityBot, Google-Extended, आदि) की सूची प्रदान करता है, साथ ही एक्सेस कॉन्फ़िगर करने और लॉग जांचने के सुझाव भी देता है।
लेखक एक विशिष्ट स्थिति का वर्णन करता है: एक वेबसाइट Google और Yandex द्वारा अच्छी तरह से अनुक्रमित है, लेकिन ChatGPT प्रतिक्रियाओं में दिखाई नहीं देती है क्योंकि robots.txt में GPTBot, ClaudeBot और PerplexityBot के लिए Disallow है। AI क्रॉलर दो प्रकार के होते हैं: मॉडल प्रशिक्षण के लिए (GPTBot, ClaudeBot, CCBot) और रीयल-टाइम वाले (OAI-SearchBot, PerplexityBot, ChatGPT-User)। AI उत्तरों में दिखाई देने के लिए, आपको जुलाई 2026 के अंत तक के कार्यशील सूची के बॉट्स के लिए पहुंच की अनुमति देनी होगी, जिनमें GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended, CCBot शामिल हैं। हर तीन महीने में robots.txt की जांच करने की सिफारिश की जाती है, क्योंकि नए उपयोगकर्ता एजेंट सामने आते हैं (उदाहरण के लिए, Google ने NotebookLM का नाम बदलकर Google-GeminiNotebook कर दिया)। robots.txt केवल पहली परत है; Content-Security-Policy, SSR की कमी (बॉट JS द्वारा लोड की गई सामग्री नहीं देख सकते), और अनंत स्क्रॉलिंग से समस्याएं उत्पन्न हो सकती हैं। पहुंच की जांच करने के लिए, लेखक लॉग्स पर grep और User-Agent स्पूफिंग के साथ curl का सुझाव देता है। तीन सामान्य गलतियाँ: पुराना robots.txt, CDN सुरक्षा जो वैध बॉट्स को ब्लॉक करती है, और यह झूठा विश्वास कि इंडेक्सिंग AI क्रॉलर पहुंच की गारंटी देती है। वर्णित मामले में फिक्स में 15 मिनट लगे और जल्दी ही ChatGPT और Perplexity में उद्धरणों में वृद्धि हुई।
स्रोत: Habr — хаб ИИ —
मूल
