ABBEL:训练大语言模型更新信念以实现高效长期交互
Cursor
Alibaba/Qwen
ABBEL 是一个框架,通过使用自然语言信念状态来隔离和监督摘要的信息内容,从而提升大语言模型在长期任务中的表现。它将与全上下文模型的性能差距缩小约 50%,同时将训练步骤减半并显著降低内存使用。
ABBEL(自编码器信念瓶颈高效学习法)解决了大语言模型在长交互中因完整历史记录无法适配上下文窗口而面临的难题。不同于传统的递归摘要方法,ABBEL将摘要定义为模型定期更新的信念状态。信念评分引入了一个辅助强化学习任务,根据信念对近期观测的重建质量进行奖励。在CollabBench协作编码环境中,采用基于重建的信念评分的ABBEL实现了0.48的测试通过率(完整上下文为0.52)和0.36的成功率(完整上下文为0.39),同时峰值令牌使用量为6.01(完整上下文为14.08),且仅需50个训练步骤(完整上下文为100个)。在组合锁任务中,领域知识信念评分使ABBEL能够接近或超越完整上下文的性能。在多目标问答中,峰值信念长度惩罚在性能损失极小的情况下降低了内存使用。该论文由伯克利AI团队的Lidayan等人撰写。
来源: BAIR (Berkeley AI) —
原文
