Investigación 🇺🇸 27.07.2026 07:02

ABBEL: Entrenando LLMs para Actualizar Creencias para una Interacción Eficiente a Largo Plazo

CursorCursor Alibaba/QwenAlibaba/Qwen
ABBEL es un marco que mejora el rendimiento de los LLM en tareas de largo horizonte al aislar y supervisar el contenido informativo de los resúmenes mediante estados de creencia en lenguaje natural. Reduce la brecha de rendimiento en comparación con modelos de contexto completo en aproximadamente un 50%, a la vez que reduce a la mitad los pasos de entrenamiento y utiliza significativamente menos memoria.
ABBEL (Autoencoder Belief Bottleneck for Efficient Learning) aborda el problema de los LLMs con interacciones largas donde el historial completo de contexto no cabe en la ventana de contexto. En lugar del resumen recursivo tradicional, ABBEL formula los resúmenes como estados de creencia que el modelo actualiza periódicamente. La calificación de creencias añade una tarea auxiliar de aprendizaje por refuerzo (RL, por sus siglas en inglés) que recompensa las creencias según qué tan bien pueden reconstruir observaciones recientes. En el entorno de codificación colaborativa CollabBench, ABBEL con calificación de creencias basada en reconstrucción logró una tasa de aciertos en pruebas de 0.48 (frente a 0.52 para contexto completo) y una tasa de éxito de 0.36 (frente a 0.39), utilizando un pico de 6,01 tokens frente a 14,08 para contexto completo, y requiriendo solo 50 pasos de entrenamiento frente a 100. En la tarea de Cerradura Combinada (Combination Lock), la calificación de creencias con conocimiento del dominio permitió a ABBEL acercarse o superar el rendimiento del contexto completo. En preguntas y respuestas multiobjetivo, una Penalización por Longitud Máxima de Creencia (Peak Belief Length Penalty) redujo el uso de memoria con una pérdida mínima de rendimiento. El artículo fue escrito por Lidayan et al. de Berkeley AI.
Fuente: BAIR (Berkeley AI) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas