Benchmark de rappel causal externe : test de la mémoire d’un assistant IA sur YDB de Yandex
Яндекс
Un benchmark de rappel causal a été exécuté sur le dépôt open-source YDB (ydb-platform/ydb) pour mesurer la capacité d’un assistant IA à retrouver des correctifs passés pour des symptômes similaires. La recherche sémantique seule a trouvé la PR correcte dans 32,1 % des cas, tandis que le parcours des liens causaux explicites (issue -> PR de fermeture) a atteint 94,5 %, soit une contribution de +62,5 points de pourcentage de la part du graphe. Le schéma se reproduit indépendamment de la langue, du domaine ou de la culture des tickets.
Les auteurs ont construit un benchmark de rappel causal sur le dépôt public ydb-platform/ydb (10 285 problèmes, 37 067 PR, C++, anglais). Ils ont extrait des paires de référence en utilisant le motif GitHub Closes/Fixes/Resolves #N (293 paires valides après filtrage des PR de bots provenant de ydbot et de github-actions). Pour chaque requête (titre de problème), deux méthodes de récupération ont été comparées : (a) similarité cosinus sémantique top-32 utilisant des embeddings MiniLM multilingues, et (b) parcours des arêtes causales depuis les mêmes graines jusqu'à une profondeur de 3. Le rappel sémantique était de 32,1 % (94/293), le rappel causal de 94,5 % (277/293), ce qui donne une contribution du graphe de +62,5 points de pourcentage. Les auteurs soulignent que le résultat clé n'est pas les chiffres exacts mais le schéma reproductible : la similarité sémantique des mots seule plafonne à environ un tiers, tandis que les liens causaux explicites augmentent considérablement le rappel. Ils fournissent les paires de référence complètes et une méthode en 6 étapes pour permettre une réplication indépendante. Le travail note également des résultats accessoires : 143 PR créées par des agents IA (principalement GitHub Copilot) et 173 PR de revert, illustrant que les problèmes de mémoire sont réels.
Source: Habr — хаб ИИ —
original
