MIT Researchers Introduce SEAL: A Step Toward Self-Improving AI
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
A team from MIT published the paper "Self-Adapting Language Models" with the SEAL framework, enabling large language models to update their own weights through self-editing and reinforcement learning. Experiments on Llama-3.2-1B-Instruct and Qwen2.5-7B showed significant improvements in few-shot learning and knowledge integration.
मैसाचुसेट्स इंस्टीट्यूट ऑफ टेक्नोलॉजी (MIT) के शोधकर्ताओं ने SEAL (सेल्फ-अडैप्टिंग एलएलएम) फ्रेमवर्क पेश किया है, जो बड़े भाषा मॉडल (LLM) को अपने वजन को अपडेट करने की अनुमति देता है। SEAL सिंथेटिक डेटा उत्पन्न करने के लिए रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करता है, जिसे 'सेल्फ-एडिटिंग' कहा जाता है, और इस डेटा पर मॉडल को फिर से प्रशिक्षित किया जाता है। बाहरी RL चक्र संपादन उत्पन्न करने की प्रक्रिया को अनुकूलित करता है, जबकि आंतरिक चक्र ग्रेडिएंट डिसेंट के माध्यम से उन संपादनों को लागू करता है। प्रशिक्षण की स्थिरता के लिए, PPO और GRPO के बजाय लेखकों ने डीपमाइंड की ReST^EM विधि को चुना। फ्रेमवर्क का दो परिदृश्यों में परीक्षण किया गया: फ्यू-शॉट लर्निंग (Llama-3.2-1B-Instruct पर) और नॉलेज इंटीग्रेशन (Qwen2.5-7B पर)। फ्यू-शॉट में, अनुकूलन सटीकता RL के बिना मॉडल के 20% की तुलना में 72.5% तक पहुंच गई। नॉलेज इंटीग्रेशन में, SEAL ने सिंथेटिक डेटा के साथ भी बेसलाइन को पीछे छोड़ दिया, और RL के दो पुनरावृत्तियों के बाद, GPT-4.1 का उपयोग करने वाले दृष्टिकोणों को भी मात दे दी। इस काम ने व्यापक चर्चा छेड़ दी है, जिसमें Hacker News भी शामिल है, खासकर AI के स्व-विकास में बढ़ती रुचि के मद्देनजर—हाल ही में Sakana AI, CMU, SJTU और अन्य की परियोजनाएं सामने आई हैं। OpenAI के सैम ऑल्टमैन ने अपने ब्लॉग 'द जेंटल सिंगुलैरिटी' में भी स्व-सुधार करने वाले AI और रोबोट के भविष्य के बारे में लिखा था। लेख में SEAL की सीमाओं को भी नोट किया गया है, जिसमें कैटास्ट्रोफिक फॉरगेटिंग और कम्प्यूटेशनल लागत शामिल हैं।
स्रोत: Synced —
मूल
