शोधमॉडल 🇺🇸 27.07.2026 17:06

MIT Researchers Introduce SEAL: A Step Toward Self-Improving AI

MITMIT MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI DeepMindDeepMind
A team from MIT published the paper "Self-Adapting Language Models" with the SEAL framework, enabling large language models to update their own weights through self-editing and reinforcement learning. Experiments on Llama-3.2-1B-Instruct and Qwen2.5-7B showed significant improvements in few-shot learning and knowledge integration.
मैसाचुसेट्स इंस्टीट्यूट ऑफ टेक्नोलॉजी (MIT) के शोधकर्ताओं ने SEAL (सेल्फ-अडैप्टिंग एलएलएम) फ्रेमवर्क पेश किया है, जो बड़े भाषा मॉडल (LLM) को अपने वजन को अपडेट करने की अनुमति देता है। SEAL सिंथेटिक डेटा उत्पन्न करने के लिए रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करता है, जिसे 'सेल्फ-एडिटिंग' कहा जाता है, और इस डेटा पर मॉडल को फिर से प्रशिक्षित किया जाता है। बाहरी RL चक्र संपादन उत्पन्न करने की प्रक्रिया को अनुकूलित करता है, जबकि आंतरिक चक्र ग्रेडिएंट डिसेंट के माध्यम से उन संपादनों को लागू करता है। प्रशिक्षण की स्थिरता के लिए, PPO और GRPO के बजाय लेखकों ने डीपमाइंड की ReST^EM विधि को चुना। फ्रेमवर्क का दो परिदृश्यों में परीक्षण किया गया: फ्यू-शॉट लर्निंग (Llama-3.2-1B-Instruct पर) और नॉलेज इंटीग्रेशन (Qwen2.5-7B पर)। फ्यू-शॉट में, अनुकूलन सटीकता RL के बिना मॉडल के 20% की तुलना में 72.5% तक पहुंच गई। नॉलेज इंटीग्रेशन में, SEAL ने सिंथेटिक डेटा के साथ भी बेसलाइन को पीछे छोड़ दिया, और RL के दो पुनरावृत्तियों के बाद, GPT-4.1 का उपयोग करने वाले दृष्टिकोणों को भी मात दे दी। इस काम ने व्यापक चर्चा छेड़ दी है, जिसमें Hacker News भी शामिल है, खासकर AI के स्व-विकास में बढ़ती रुचि के मद्देनजर—हाल ही में Sakana AI, CMU, SJTU और अन्य की परियोजनाएं सामने आई हैं। OpenAI के सैम ऑल्टमैन ने अपने ब्लॉग 'द जेंटल सिंगुलैरिटी' में भी स्व-सुधार करने वाले AI और रोबोट के भविष्य के बारे में लिखा था। लेख में SEAL की सीमाओं को भी नोट किया गया है, जिसमें कैटास्ट्रोफिक फॉरगेटिंग और कम्प्यूटेशनल लागत शामिल हैं।
स्रोत: Synced — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार