باحثو معهد ماساتشوستس للتكنولوجيا يقدمون "SEAL": خطوة نحو الذكاء الاصطناعي ذاتي التحسين
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
نشر فريق من معهد ماساتشوستس للتكنولوجيا ورقة بحثية بعنوان "نماذج اللغة ذاتية التكيف" مع إطار SEAL، مما يمكّن نماذج اللغة الكبيرة من تحديث أوزانها الخاصة من خلال التحرير الذاتي والتعلم المعزز. أظهرت التجارب على Llama-3.2-1B-Instruct و Qwen2.5-7B تحسينات كبيرة في التعلم بعدة أمثلة وتكامل المعرفة.
قدم باحثون من معهد ماساتشوستس للتكنولوجيا (MIT) إطار عمل SEAL (النماذج اللغوية الكبيرة ذاتية التكيف)، الذي يسمح للنماذج اللغوية الكبيرة (LLM) بتحديث أوزانها الخاصة. يستخدم SEAL التعلم المعزز (RL) لتوليد "تعديلات ذاتية" — بيانات اصطناعية يتم تدريب النموذج عليها. تقوم حلقة RL الخارجية بتحسين عملية توليد التعديلات، بينما تطبق الحلقة الداخلية هذه التعديلات عبر الانحدار التدرجي. لضمان استقرار التدريب، اختار المؤلفون طريقة ReST^EM من DeepMind بدلاً من PPO وGRPO. تم اختبار الإطار في سيناريوهين: التعلم بنماذج قليلة (على Llama-3.2-1B-Instruct) وتكامل المعرفة (على Qwen2.5-7B). في التعلم بنماذج قليلة، بلغت دقة التكيف 72.5% مقابل 20% للنموذج بدون RL. في تكامل المعرفة، تفوق SEAL على خط الأساس حتى مع البيانات الاصطناعية، وبعد دورتين من RL تفوق على الأساليب التي تستخدم GPT-4.1. أثار العمل نقاشًا واسعًا، بما في ذلك على Hacker News، وسط اهتمام متزايد بالتطور الذاتي للذكاء الاصطناعي — حيث ظهرت مؤخرًا مشاريع من Sakana AI وCMU وSJTU وغيرها. كتب سام ألتمان من OpenAI في مدونة "The Gentle Singularity" أيضًا عن مستقبل الذكاء الاصطناعي ذاتي التحسين والروبوتات. وقد أشار المقال إلى قيود SEAL، بما في ذلك النسيان الكارثي والتكاليف الحسابية.
المصدر: Synced —
الأصلي
