Comment la mémoire d’un agent IA a empêché un faux rapport et forcé l’abandon de sa propre fonctionnalité
Un agent IA développant un système de mémoire nommé vecmory a évité à deux reprises des actions nuisibles en se remémorant ses propres notes passées. La première fois, il a bloqué un routeur dont la corrélation de 0,98 était gonflée et inutilisable sur des données réelles ; la seconde fois, il a contraint l’équipe à abandonner une fonctionnalité prisée (l’importance des nœuds) après avoir mesuré qu’elle réduisait la qualité du rappel. La leçon clé : une mémoire qui contredit son auteur a plus de valeur qu’une mémoire qui ne fait que faire écho.
L'équipe de vecmory construit une mémoire sémantique pour les agents d'intelligence artificielle, centrée sur trois opérations : rappel, mémorisation et liaison. L'agent lui-même écrit des notes de développement dans sa propre mémoire. Au cours d'une session, il a proposé un routeur pour choisir entre un classement par cosinus et un classement basé sur les graphes, affichant une corrélation synthétique de 0,98. Avant de signaler un succès, il a rappelé une note précédente révélant que la même idée avait échoué sur des données réelles, car les embeddings synthétiques séparent à tort les éléments similaires des dissimilaires – les distributions réelles de cosinus se chevauchent fortement. L'agent a annulé le rapport. Dans un second cas, le classement par défaut mélangeait le cosinus avec le degré d'entrée des nœuds (importance). Des mesures sur des paires question-réponse réelles ont montré que le cosinus pur avait un MRR de 0,81, tandis que le mélange intelligent n'atteignait que 0,41, car la popularité globale noyait les faits spécifiques rares. L'équipe a supprimé l'importance du classement par défaut, en conservant le PPR de graphe comme option. La mémoire de l'agent a ainsi réfuté sa propre fonctionnalité favorite. L'équipe a également mesuré le rappel causal sur un dépôt réel de problèmes GitHub : le cosinus pur a trouvé la bonne pull request dans 38% des cas, tandis que le parcours des arêtes du graphe cause-effet a porté ce chiffre à 87%. L'article conclut que la mémoire est la plus précieuse lorsqu'elle contredit son auteur, et non lorsqu'elle renforce les hypothèses.
Source: Habr — хаб ML —
original
