التطبيقات 🇷🇺 27.07.2026 00:01

أي زواحف ذكاء اصطناعي يجب السماح بها في ملف robots.txt لظهور موقعك في إجابات الذكاء الاصطناعي في عام 2026

OpenAIOpenAI AnthropicAnthropic Perplexity AIPerplexity AI Google/DeepMindGoogle/DeepMind ЯндексЯндекс СберСбер AppleApple Common CrawlCommon Crawl
تتناول المقالة مشكلة عدم ظهور المواقع في مساعدات الذكاء الاصطناعي: فغالبًا ما يمنع ملف robots.txt وصول الزواحف المخصصة للتدريب والاستعلام الفوري، على الرغم من أن الفهرسة العادية تعمل بشكل جيد. تقدم المقالة قائمة بالزواحف ذات الصلة (GPTBot، PerplexityBot، Google-Extended، إلخ)، إلى جانب نصائح لتكوين الوصول والتحقق من السجلات.
يصف المؤلف حالة نموذجية: موقع ويب مفهرس جيدًا بواسطة Google وYandex، لكنه لا يظهر في ردود ChatGPT لأن ملف robots.txt يحتوي على تعطيل لـ GPTBot وClaudeBot وPerplexityBot. هناك نوعان من زاحفات الذكاء الاصطناعي: تلك الخاصة بتدريب النماذج (GPTBot وClaudeBot وCCBot) وتلك العاملة في الوقت الفعلي (OAI-SearchBot وPerplexityBot وChatGPT-User). لكي يظهر الموقع في إجابات الذكاء الاصطناعي، تحتاج إلى السماح بالوصول للبوتات الموجودة في قائمة العمل حتى نهاية يوليو 2026، والتي تتضمن GPTBot وChatGPT-User وOAI-SearchBot وClaudeBot وanthropic-ai وPerplexityBot وGoogle-Extended وYandexBot/YandexAI وGigaChat وApplebot-Extended وCCBot. يُوصى بفحص ملف robots.txt كل ثلاثة أشهر، حيث تظهر عوامل مستخدم جديدة (على سبيل المثال، أعادت Google تسمية NotebookLM إلى Google-GeminiNotebook). ملف robots.txt هو فقط الطبقة الأولى؛ يمكن أن تنشأ مشكلات من سياسة أمان المحتوى (Content-Security-Policy)، وعدم وجود العرض من جانب الخادم (SSR) (البوتات لا تستطيع رؤية المحتوى المحمّل بواسطة جافاسكريبت)، والتمرير اللانهائي. للتحقق من الوصول، يقترح المؤلف استخدام grep على السجلات وcurl مع انتحال عامل المستخدم. ثلاثة أخطاء شائعة: ملف robots.txt قديم، حماية شبكة توصيل المحتوى (CDN) التي تمنع البوتات الشرعية، والثقة الخاطئة في أن الفهرسة تضمن وصول زاحفات الذكاء الاصطناعي. استغرق الإصلاح في الحالة الموصوفة 15 دقيقة وأدى بسرعة إلى زيادة في الاستشهادات في ChatGPT وPerplexity.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة