ABBEL: treinando LLMs para atualizar crenças em interações longas e eficientes
Cursor
Alibaba/Qwen
ABBEL é uma estrutura que melhora o desempenho de LLMs em tarefas de longo prazo ao isolar e supervisionar o conteúdo informacional de resumos usando estados de crença em linguagem natural. Ela reduz a lacuna de desempenho em comparação com modelos de contexto completo em cerca de 50%, ao mesmo tempo que reduz pela metade as etapas de treinamento e usa significativamente menos memória.
O ABBEL (Autoencoder Belief Bottleneck for Efficient Learning, ou Gargalo de Crença com Autoencoder para Aprendizado Eficiente) aborda o problema dos LLMs (Modelos de Linguagem de Grande Porte) que têm dificuldade com interações longas, onde o histórico completo de contexto não cabe na janela de contexto. Em vez da sumarização recursiva tradicional, o ABBEL formula sumários como estados de crença que o modelo atualiza periodicamente. A classificação de crenças adiciona uma tarefa auxiliar de RL (Aprendizado por Reforço) que recompensa as crenças com base em quão bem elas conseguem reconstruir observações recentes. No ambiente de codificação colaborativa CollabBench, o ABBEL com classificação de crenças baseada em reconstrução alcançou uma taxa de aprovação de teste de 0,48 (contra 0,52 para contexto completo) e taxa de sucesso de 0,36 (contra 0,39), enquanto usou 6,01 tokens de pico contra 14,08 para contexto completo, e exigiu apenas 50 passos de treinamento contra 100. Na tarefa de Fecho de Combinação, a classificação de crenças com conhecimento de domínio permitiu que o ABBEL se aproximasse ou superasse o desempenho do contexto completo. Na QA (Resposta a Perguntas) multiobjetivo, uma Penalidade de Comprimento de Pico de Crença reduziu o uso de memória com perda mínima de desempenho. O artigo foi escrito por Lidayan e colaboradores da Berkeley AI.
Fonte: BAIR (Berkeley AI) —
original
