ABBEL: Training LLMs to Update Beliefs for Efficient Long-term Interaction
Cursor
Alibaba/Qwen
ABBEL is a framework for training language models to update beliefs in the form of textual states, enabling efficient context compression during long-term interactions. The method uses belief grading through observation reconstruction, reducing the gap with full-context models in collaborative programming and other tasks.
Исследователи из BAIR представили фреймворк ABBEL (Autoencoder Belief Bottleneck for Efficient Learning), который решает проблему масштабирования контекста LLM при длительных взаимодействиях. Традиционная рекурсивная суммаризация (компакция контекста) снижает производительность, особенно в задачах с дефицитом качественных данных, таких как коллаборативная генерация кода. ABBEL изолирует задачу генерации суммаризации, формулируя её как обновление состояний убеждений (belief states) — текстовых представлений истории взаимодействия. Для обучения используется оценка убеждений (belief grading): модель поощряется за то, насколько хорошо из текущего состояния убеждения может быть реконструировано последнее наблюдение. В среде CollabBench (коллаборативное программирование) ABBEL с реконструктивной оценкой сокращает разрыв с полноконтекстными моделями примерно на 50% и обучается в два раза быстрее, чем без оценки убеждений. В симуляции игры Combination Lock метод с оценкой, использующей знания предметной области, достигает или превосходит производительность полноконтекстных моделей. В многозадачном вопросно-ответном окружении введение штрафа на пиковую длину убеждения (Peak Belief Penalty) позволяет значительно снизить использование памяти без существенного падения качества. ABBEL использует O(N/K) накладных расходов на суммаризацию, где N — общее число действий, K — число действий между запусками суммаризации. Исследователи отмечают, что в будущем возможны комбинации разных видов памяти (рабочей, кратко- и долговременной) для более мощных систем.
출처: BAIR (Berkeley AI) —
원문
