ReasoningBank : Un Cadre Mémoire pour l'Apprentissage des Agents IA à partir des Succès et des Échecs
Google/DeepMind
Les chercheurs de Google proposent ReasoningBank, un nouveau cadre mémoire pour agents qui distille des stratégies de raisonnement généralisables à partir d'expériences réussies et échouées, permettant un apprentissage continu après le déploiement. Évalué sur des benchmarks de navigation web et d'ingénierie logicielle, il améliore l'efficacité et l'efficience des agents. Le cadre utilise un scaling temporel de test sensible à la mémoire (MaTTS) pour exploiter les trajectoires d'exploration.
Des chercheurs de Google Cloud, Jun Yan et Chen-Yu Lee, ont présenté ReasoningBank, un nouveau cadre de mémoire pour agents présenté à l'ICLR 2025. Il pallie la limitation des agents actuels qui n'apprennent pas de leurs expériences passées après leur déploiement. Contrairement aux méthodes existantes qui stockent des journaux d'actions exhaustifs ou uniquement les workflows réussis, ReasoningBank distille des schémas de raisonnement transférables de haut niveau, issus à la fois des succès et des échecs. Chaque élément de mémoire est stocké sous forme d'enregistrements structurés contenant le scénario, l'instruction, la stratégie de raisonnement et l'esquisse d'action. Le système fonctionne en boucle fermée de récupération, extraction et consolidation, en utilisant un LLM comme juge pour l'auto-évaluation. ReasoningBank introduit également le passage à l'échelle mémoire-conscient au moment du test (memory-aware test-time scaling, ou MaTTS), qui utilise des trajectoires d'exploration pour générer des mémoires de haute qualité grâce à des signaux contrastifs et de raffinement. Évalué sur WebArena et SWE-Bench-Verified avec Gemini-2.5-Flash, ReasoningBank a surpassé les références, y compris Vanilla ReAct, Synapse et Agent Workflow Memory, en termes de taux de réussite des tâches et d'efficacité. Les chercheurs ont observé une maturité stratégique au fil du temps, où des règles procédurales simples ont évolué en structures logiques complexes et préventives.
Source: Google Research —
original
