طريق جديد لتفسير نماذج اللغة الكبيرة: تحليل الأوزان بتكلفة بيانات أقل من 1٪
OpenAI
Alibaba/Qwen
يقترح باحثون من IQuest Research وSafe AI Forum وOxford وStanford وTsinghua طريقة تحليل الأوزان المتفرقة (SWD)، وهي طريقة لتفسير نماذج اللغة الكبيرة عن طريق تحليل مصفوفات الأوزان المُدرَّبة مسبقًا إلى عوامل متفرقة، مما يلغي الحاجة إلى تدريب شبكات بديلة منفصلة. تستخدم SWD أقل من 1٪ من البيانات المطلوبة للأساليب القائمة على التدريب مثل Transcoder، وتتوسع إلى نماذج بحجم 27 مليار معامل، وتمكن من استخراج الدوائر وتحريرًا مستهدفًا مباشرة من الأوزان.
يقدم معهد أبحاث آي كويست، بالتعاون مع منتدى الذكاء الاصطناعي الآمن، وجامعة أكسفورد، وجامعة ستانفورد، وجامعة تسينغهوا، نهجًا جديدًا للتفسير الميكانيكي للنماذج اللغوية الكبيرة، يُسمى تحليل الوزن المتناثر (SWD). بدلاً من تدريب شبكة تمثيل متناثرة منفصلة لتقريب طبقات النموذج، يقوم SWD مباشرة بتحليل مصفوفة الأوزان الكثيفة إلى مصفوفتين متناثرتين A وB، حيث تصبح الأبعاد المتوسطة المشتركة وحدات اختناق يمكن تقييمها واختيارها وإزالتها بشكل مستقل. يتيح ذلك للباحثين استخراج دوائر المهام مباشرة من الأوزان. في تجارب المصفوفة الواحدة التي تطابق دقة الاستبدال، يستخدم SWD أقل من 1% من البيانات المطلوبة مقارنة بالأساليب الأساسية القائمة على التدريب مثل Transcoder. على نماذج GPT-2 وQwen2.5 وQwen3.5-27B، يحقق SWD عادةً أهداف الكفاية والضرورة نفسها مع عدد أقل من وحدات الاختناق والاتصالات النشطة. تمتد الطريقة إلى نماذج بحجم 27 مليار معامل وتغطي جميع مصفوفات الأوزان البالغ عددها 48 للانتباه والطبقات متعددة الحدود لنموذج GPT-2 الصغير، مع نسخة بدون بيانات لا تتطلب نص معايرة. يذكر التقرير أنه في نموذج GPT-2 الصغير، يحقق SWD انخفاضًا منخفضًا في الإنتروبيا المتقاطعة مع بضعة آلاف فقط من رموز المعايرة، بينما تحتاج الأساليب الأساسية القائمة على التدريب إلى حوالي 10^6 رمزًا. الاستبدال الكامل للنموذج على GPT-2 الصغير، باستخدام SWD-FT، يخفض الإنتروبيا المتقاطعة من 3.90 إلى 3.44 مع نفس عدد الاتصالات، باستخدام حوالي 20.6 مليون رمزًا مقارنة بـ 2.884 مليار للخط الأساسي للتدريب المتفرق. يُظهر التحليل الدلالي لوحدات الاختناق عالية الرتبة في مهمة "أكبر من" أن أربعًا من ست وحدات تستجيب للأرقام أو السنوات أو الكميات أو المقاييس. أدت تجربة تحرير مستهدفة على وحدة واحدة (c205) إلى زيادة هامش السجل للإجابة الصحيحة بمقدار 0.216 مع آثار جانبية ضئيلة، مما يوضح أن الاتجاهات المشتقة من SWD يمكن استخدامها للتحكم الدقيق في السلوك.
المصدر: QbitAI 量子位 —
الأصلي
