MarathonMemBench : un nouveau benchmark pour tester la mémoire de votre agent LLM
Anthropic
MarathonMemBench est une nouvelle plateforme de benchmark qui teste la mémoire à long terme des agents LLM à travers des conversations naturelles prolongées, évitant ainsi le besoin de modifications spéciales de l'agent. Elle a été créée car les benchmarks de mémoire existants nécessitent soit le chargement de dialogues pré-enregistrés (off-policy), soit des capacités supplémentaires de l'agent telles que des instantanés d'état ou un accès mémoire par programmation. La plateforme est conçue pour être agnostique envers l'agent, ne nécessitant qu'une interface de chat, et permet d'évaluer la capacité de l'agent à se souvenir et à maintenir des faits au cours de longues conversations qui dépassent la fenêtre de contexte.
L'article présente MarathonMemBench, une plateforme de benchmarking de la mémoire à long terme des agents LLM. L'auteur soutient que la fenêtre de contexte finie des modèles basés sur des transformeurs est une limitation fondamentale, et que les agents doivent utiliser des outils de mémoire externes, comme l'écriture dans des fichiers, pour la surmonter. Les benchmarks de mémoire existants sont critiqués pour exiger que les agents soient spécialement adaptés : les benchmarks hors ligne (par exemple, LoCoMo, LongMemEval, MemoryAgentBench, BEAM) chargent des dialogues préenregistrés, tandis que ceux en ligne (par exemple, AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) exigent des instantanés d'état, un accès mémoire programmatique ou fonctionnent dans leur propre environnement. MarathonMemBench, quant à lui, fonctionne comme une plateforme où un personnage LLM converse avec l'agent pendant des heures, présente des faits, les modifie, et teste enfin la mémorisation. Il exige seulement que l'agent dispose d'une interface de chat. L'article décrit les plans pour des sections futures couvrant les benchmarks existants, l'architecture de la plateforme, et les résultats d'agents open-source, qui ont été étonnamment solides.
Source: Habr — хаб ИИ —
original
