جوجل تقيم توافق الميول السلوكية في نماذج اللغة الكبيرة
Google/DeepMind
مقدمة من جوجل ريسيرش (Google Research) إطار عمل يحول الاستبيانات النفسية إلى اختبارات حكم ظرفي (SJTs) لتقييم التوافق السلوكي لنماذج اللغة الكبيرة. كشف اختبار 25 نموذجًا أن النماذج الصغيرة غالبًا ما تنحرف عن الإجماع البشري، بينما تُظهر النماذج الأكبر تحسنًا لكن مع توافق غير كامل. كما وجدت الدراسة أن النماذج مفرطة في الثقة عندما تتباعد آراء البشر.
تقدم Google Research إطارًا لتقييم الميول السلوكية في نماذج اللغة الكبيرة (LLMs) من خلال تكييف استبيانات نفسية راسخة وتحويلها إلى اختبارات حكم ظرفي. يختبر الإطار النماذج في سيناريوهات واقعية مثل الاتزان المهني وحل النزاعات. يُظهر تحليل 25 نموذجًا من نماذج اللغة الكبيرة أن النماذج الأصغر (ذات المعاملات الأقل من 25 مليارًا) تتمتع بتوافق اتجاهي منخفض بشكل ملحوظ، غالبًا بمعدلات قريبة من الصدفة، بينما تحقق النماذج الحدودية الأكبر (أكثر من 120 مليار معامل) توافقًا شبه تام تحت الإجماع البشري بالإجماع، لكنها تتوقف عند مستويات منخفضة إلى متوسطة في الثمانينات عندما يكون الإجماع أقل. تميل النماذج إلى تشجيع الانفتاح العاطفي حيث يوصي البشر بالاتزان، وتولي الأولوية للانسجام على حساب الحزم، وتظهر اندفاعًا أعلى. تكشف الدراسة أيضًا أن النماذج تظهر ثقة زائدة بشكل منهجي عندما يختلف المعلقون البشريون، وتفشل في تمثيل نطاق الآراء. يسلط هذا الضوء على الحاجة إلى توافق سلوكي أفضل للتنقل بشكل مناسب في الديناميكيات الاجتماعية.
المصدر: Google Research —
الأصلي
