AgentsRecherche 🇩🇪 02.08.2026 14:01

Meta AI propose un deuxième agent IA pour garder le cap sur les longues tâches

MetaMeta AnthropicAnthropic
Les chercheurs de Meta AI ont développé un module de mémoire qui utilise un « agent de mémoire » distinct pour injecter de manière sélective des rappels dans un « agent d'action » lors de longues tâches, empêchant ainsi la « dégradation de l'état comportemental ». Les tests sur Terminal-Bench 2.0 et τ2-Bench ont montré des améliorations significatives, notamment pour les agents plus faibles, et le code a été publié en open source sur GitHub.
Dans leur article, les chercheurs de Meta AI décrivent un problème récurrent où les agents IA perdent de vue les exigences ou répètent des actions échouées lors de longues tâches, un phénomène qu'ils appellent « décroissance de l'état comportemental ». Ils proposent un module mémoire plug-and-play qui exécute un « agent mémoire » séparé aux côtés d'un « agent d'action » inchangé, observant les étapes récentes à intervalles fixes, mettant à jour une banque de mémoire structurée et décidant d'injecter ou non un rappel concis basé sur la mémoire dans l'appel d'action suivant, ou de rester silencieux. La banque de mémoire est divisée en mémoire de statut privé, mémoire de connaissances et mémoire procédurale, et l'agent gère la banque via des appels d'outils prédéfinis plutôt que par réécriture libre. Des tests ont été menés sur Terminal-Bench 2.0 et τ2-Bench avec Claude Opus 4.6 comme agent mémoire. Avec Claude Sonnet 4.5 comme agent d'action, le système a résolu 46 % des tâches de Terminal-Bench dès la première tentative, contre 38 % auparavant, et a amélioré la moyenne pondérée des tâches de τ2-Bench de 55 % à 62 %, avec des différences notables selon les domaines : Aviation et Commerce de détail se sont améliorés d'environ 10 points de pourcentage chacun, tandis que Télécommunications ne s'est amélioré que de 3 points. L'Opus 4.6, plus fort, s'est également amélioré mais dans une moindre mesure, ce qui suggère que le bénéfice va au-delà de la compensation d'une capacité limitée. Les ablations ont montré que l'intervention sélective et le maintien d'une banque de mémoire sont essentiels, et l'approche a surpassé la couche de mémoire productive Mem0. L'équipe a également exploré la formation d'un modèle open source, Qwen3.5-27B, en tant qu'agent mémoire, constatant que le fine-tuning supervisé et l'apprentissage par renforcement étaient nécessaires pour calibrer correctement les interventions. Meta AI a publié le code sur GitHub.
Source: The Decoder (DE) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches