ABBEL : Entraîner les LLM à mettre à jour leurs croyances pour une interaction efficace à long terme
Cursor
Alibaba/Qwen
ABBEL est un framework qui améliore les performances des LLM dans les tâches à long horizon en isolant et en supervisant le contenu informationnel des résumés à l'aide d'états de croyance en langage naturel. Il réduit l'écart de performance par rapport aux modèles à contexte complet d'environ 50 %, tout en réduisant de moitié les étapes d'entraînement et en utilisant beaucoup moins de mémoire.
ABBEL (Autoencoder Belief Bottleneck for Efficient Learning, c'est-à-dire goulot d'étranglement de croyance par auto-encodeur pour un apprentissage efficace) aborde le problème des grands modèles de langue (LLM) qui peinent lors d'interactions longues lorsque l'historique complet du contexte ne tient pas dans la fenêtre de contexte. Au lieu du résumé récursif traditionnel, ABBEL formule les résumés comme des états de croyance que le modèle met à jour périodiquement. Le calibrage des croyances ajoute une tâche d'apprentissage par renforcement auxiliaire qui récompense les croyances en fonction de leur capacité à reconstruire les observations récentes. Dans l'environnement de codage collaboratif CollabBench, ABBEL avec calibrage des croyances basé sur la reconstruction a obtenu un taux de réussite aux tests de 0,48 (contre 0,52 pour le contexte complet) et un taux de succès de 0,36 (contre 0,39), tout en utilisant un pic de 6,01 jetons contre 14,08 pour le contexte complet, et en ne nécessitant que 50 étapes d'entraînement contre 100. Dans la tâche Combination Lock, le calibrage des croyances basé sur la connaissance du domaine a permis à ABBEL d'approcher ou de dépasser les performances du contexte complet. Dans le cadre du question-réponse multi-objectifs, une pénalité de longueur de croyance de pic a réduit l'utilisation de la mémoire avec une perte de performance minimale. L'article a été rédigé par Lidayan et al. de Berkeley AI.
Source: BAIR (Berkeley AI) —
original
