هلوسات نماذج اللغة الكبيرة: كيف تختلق نماذج الذكاء الاصطناعي حزمًا غير موجودة

OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral
تكشف دراسة جديدة أن نماذج اللغة الكبيرة تختلق أسماء حزم برمجية بشكل متكرر، مما يشكل خطر هجوم على سلسلة التوريد. اختبر الباحثون 16 نموذجًا، مولّدين 576,000 عينة برمجية، ووجدوا أن متوسط 19.7% من توصيات الحزم كانت وهمية. كما يقترحون استراتيجيات للتخفيف من هذا الخطر.
دراسة 'لدينا حزمة من أجلك!' قامت بتحليل الهلوسات الحزمةية في نماذج الذكاء الاصطناعي المولدة للكود. اختبر الباحثون 16 نموذجًا، بما في ذلك GPT-3.5 وGPT-4 وGPT-4 Turbo وCodeLlama وDeepSeek Coder وغيرها، مولّدين 576,000 عينة كود لكل من لغتي بايثون وجافاسكريبت. اكتشفوا أن 440,445 توصية (19.7%) كانت هلوسات، حيث كانت النماذج التجارية تهلس بنسبة لا تقل عن 5.2% بينما النماذج المفتوحة بلغت 21.7%. كانت النماذج أكثر عرضة للهلوسة في المواضيع الحديثة، وانخفاض درجة الحرارة قلل من المخاطر لكنه لم يلغها. كما وجدت الدراسة أن النماذج غالبًا ما تكرر هلوساتها الخاصة، وأن معظم الأسماء الهلوسية ليست أخطاء إملائية بسيطة لحزم حقيقية. حصل البحث على جائزة الورقة المتميزة في مؤتمر USENIX Security 2025.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة