ABBEL: 언어모델이 효율적인 장기 상호작용을 위해 신념을 업데이트하도록 훈련
Cursor
Alibaba/Qwen
ABBEL은 자연어 신념 상태를 사용하여 요약의 정보 내용을 분리하고 감독함으로써 장기 과제에서 LLM 성능을 향상시키는 프레임워크입니다. 전체 컨텍스트 모델과의 성능 격차를 약 50% 줄이면서 훈련 단계를 절반으로 줄이고 메모리를 훨씬 적게 사용합니다.
ABBEL(자기부호화 신념 병목을 통한 효율적 학습)은 긴 상호작용에서 전체 맥락 기록이 맥락 창에 들어가지 못해 LLM이 어려움을 겪는 문제를 해결합니다. 전통적인 재귀적 요약 대신, ABBEL은 요약을 모델이 주기적으로 업데이트하는 신념 상태로 공식화합니다. 신념 등급화는 보조 강화 학습 과제를 추가하여, 최근 관측치를 얼마나 잘 재구성할 수 있는지에 따라 신념에 보상을 부여합니다. CollabBench 협업 코딩 환경에서 재구성 기반 신념 등급화를 사용한 ABBEL은 테스트 통과율 0.48(전체 맥락의 0.52 대비)과 성공률 0.36(0.39 대비)을 달성했으며, 최대 토큰 사용량은 전체 맥락의 14.08 토큰 대비 6.01 토큰, 훈련 단계는 100단계 대비 50단계만 필요했습니다. 콤비네이션 자물쇠 과제에서는 도메인 지식 기반 신념 등급화를 통해 ABBEL이 전체 맥락 성능에 근접하거나 능가했습니다. 다중 목적 질의응답에서는 최대 신념 길이 패널티를 적용하여 성능 손실을 최소화하면서 메모리 사용량을 줄였습니다. 이 논문은 버클리 AI의 Lidayan 등이 저술했습니다.
출처: BAIR (Berkeley AI) —
원문
