연구모델 🇺🇸 27.07.2026 17:06

MIT, 자기 개선 AI를 향한 새로운 단계 'SEAL' 공개

MITMIT MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI DeepMindDeepMind
MIT 연구진이 대규모 언어 모델이 강화 학습을 통해 자체 가중치를 업데이트할 수 있게 하는 프레임워크인 SEAL(Self-Adapting LLMs)을 제안했습니다. 이 방법은 훈련 데이터를 생성하기 위해 자체 편집을 수행하며, 다운스트림 작업에서 성능을 향상시킵니다. 퓨샷 학습 및 지식 통합에 대한 실험 결과, 기준선 대비 큰 성능 향상을 보였습니다.
MIT 연구진은 '자가 적응 언어 모델(Self-Adapting Language Models)'이라는 제목의 논문을 발표하며, 대규모 언어 모델(LLM)이 자신의 가중치를 스스로 업데이트할 수 있게 해주는 프레임워크인 SEAL을 소개했습니다. 이 모델은 자기 편집을 통해 합성 훈련 데이터를 생성하고, 이를 강화 학습을 통해 학습합니다. 보상은 업데이트된 모델의 다운스트림 성능을 기반으로 합니다. Llama-3.2-1B-Instruct를 사용한 퓨삿 러닝 실험에서 72.5%의 적응 성공률을 달성하여 기준선을 크게 능가했습니다. Qwen2.5-7B를 사용한 지식 통합에서 SEAL은 기준선보다 지속적으로 우수한 성능을 보였으며, 때로는 두 번의 반복 후 GPT-4.1이 생성한 데이터보다 나은 결과를 보였습니다. 논문은 파괴적 망각과 계산 오버헤드와 같은 한계를 지적합니다. 이 시점은 자가 진화 AI에 대한 관심이 높아지는 시기와 맞물리며, Sakana AI/UBC, CMU, SJTU, CUHK/vivo의 관련 연구와 OpenAI CEO인 샘 알트만의 발언도 포함됩니다.
출처: Synced — 원문
관련 게시물 ↓
새로운 뉴스