Externe Causal Recall Benchmark: Testen van AI-assistent geheugen op YDB van Yandex
Яндекс
Er is een causal recall-benchmark uitgevoerd op de open-source YDB-repository (ydb-platform/ydb) om te meten hoe goed een AI-assistent eerdere fixes voor soortgelijke symptomen kan terugvinden. Alleen semantisch zoeken vond de juiste pull request in 32,1% van de gevallen, terwijl het doorlopen van expliciete causale verbanden (issue -> afsluitende pull request) een score van 94,5% opleverde, een toename van +62,5 procentpunt dankzij de graaf. Dit patroon is reproduceerbaar onafhankelijk van taal, domein of ticketcultuur.
De auteurs hebben een causale recall-benchmark opgebouwd op basis van de openbare ydb-platform/ydb-repository (10.285 issues, 37.067 PR's, C++, Engels). Ze hebben gouden paren geëxtraheerd met behulp van het GitHub Closes/Fixes/Resolves #N-patroon (293 geldige paren na het filteren van bot-PR's van ydbot en github-actions). Voor elke query (issue-titel) werden twee retrievalmethoden vergeleken: (a) semantische cosinusovereenkomst top-32 met behulp van meertalige MiniLM-embeddings, en (b) traversatie van causale randen vanaf dezelfde seeds tot diepte 3. Semantische recall was 32,1% (94/293), causale recall was 94,5% (277/293), wat een grafiekbijdrage van +62,5 procentpunten oplevert. De auteurs benadrukken dat het belangrijkste resultaat niet de exacte getallen zijn, maar het reproduceerbare patroon: semantische woordovereenkomst alleen bereikt maximaal ongeveer een derde, terwijl expliciete causale verbanden de recall dramatisch verbeteren. Ze bieden volledige gouden paren en een methode in 6 stappen om onafhankelijke replicatie mogelijk te maken. Het werk vermeldt ook toevallige bevindingen: 143 PR's gemaakt door AI-agenten (voornamelijk GitHub Copilot) en 173 revert-PR's, wat illustreert dat geheugenproblemen reëel zijn.
Bron: Habr — хаб ИИ —
origineel
