رخيصة التوليد، باهظة التحقق: التكلفة الخفية لمخرجات الذكاء الاصطناعي

DeepMindDeepMind Google/DeepMindGoogle/DeepMind AnthropicAnthropic OpenAIOpenAI DeepSeekDeepSeek
يستكشف المقال اللامتناظر الذي أدخله الذكاء الاصطناعي: بينما أصبح توليد المسودات والإجابات رخيصًا، يظل التحقق من دقتها صعبًا ومكلفًا. يسلط الضوء على أبحاث تظهر أنه حتى الحقائق الفردية الصحيحة يمكن أن تتحد لتشكل استنتاجات خاطئة، وأن أدوات التحقق، البشرية والآلية، لها قيود كبيرة.
تتناول المقالة التحدي المتمثل في التحقق من المحتوى المُنشأ بالذكاء الاصطناعي، مع التأكيد على عدم التماثل بين انخفاض تكلفة التوليد وارتفاع تكلفة التحقق. وجد باحثون في جامعة تايوان الوطنية أن نماذج اللغة يمكنها دمج حقائق قابلة للتحقق حول أشخاص مختلفين في سيرة ذاتية واحدة لشخص غير موجود؛ وقد فاتت المقاييس الواقعية القياسية هذا الأمر، وبعد تعديلها لمراعاة غموض الكيانات، انخفضت درجات أربعة نماذج مفتوحة بأكثر من 10%. اختبرت دراسة بعنوان "توخَّ الحذر عند التحقق" خمسة مقاييس واقعية على إحدى عشرة مجموعة بيانات، فوجدت تناقضات وأخطاء، خاصة عندما كان النص الداعم بعيدًا عن الادعاء. وفي تجارب بشرية، أدت المساعدة بالذكاء الاصطناعي إلى تسريع التحقق لكنها أدت إلى الثقة المفرطة عندما أعطى النموذج تفسيرات مقنعة ولكن خاطئة؛ وقد خفف إظهار الإيجابيات والسلبيات من هذا التأثير لكنه لم يقدم ميزة كبيرة مقارنة بالبحث. تقارن المقالة التحقق عبر المجالات: ففي البرمجة توجد المترجمات والاختبارات، وفي الرياضيات يُستخدم التحقق الرسمي من البراهين (على سبيل المثال، حل AlphaProof وAlphaGeometry 2 أربع مسائل في الأولمبياد الدولي للرياضيات 2024)، لكن التحليل والاستراتيجية أصعب في التحقق. تشمل الاقتراحات عرض المصادر أولاً، كما في نهج "السمة أولاً، ثم التوليد"، واستخدام مكافآت العملية (ThinkPRM) للتحقق من خطوات الاستدلال. تذكر المقالة أيضًا نهج المعهد الوطني للمعايير والتكنولوجيا القائم على المخاطر، والقانون الأوروبي للذكاء الاصطناعي، اللذين يتطلبان مزيدًا من التوثيق والرقابة للأنظمة عالية الخطورة.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة