ForschungAnwendungen 🇷🇺 31.07.2026 01:02

Externer Kausalabruf-Benchmark: Test der KI-Assistenten-Speicherung auf YDB von Yandex

ЯндексЯндекс
Ein Benchmark für kausalen Abruf wurde auf dem Open-Source-YDB-Repository (ydb-platform/ydb) durchgeführt, um zu messen, wie gut ein KI-Assistent frühere Korrekturen für ähnliche Symptome abruft. Semantische Suche allein fand in 32,1% der Fälle den richtigen PR, während die Verfolgung expliziter kausaler Kanten (Issue -> schließender PR) 94,5% erreichte, was einem Beitrag des Graphen von +62,5 Prozentpunkten entspricht. Das Muster reproduziert sich unabhängig von Sprache, Domäne oder Ticket-Kultur.
Die Autoren entwickelten einen kausalen Recall-Benchmark auf dem öffentlichen Repository ydb-platform/ydb (10.285 Issues, 37.067 Pull-Requests, C++, Englisch). Sie extrahierten Gold-Paare mithilfe des GitHub-Musters Closes/Fixes/Resolves #N (293 gültige Paare nach dem Herausfiltern von Bot-PRs von ydbot und github-actions). Für jede Abfrage (Issue-Titel) wurden zwei Retrieval-Methoden verglichen: (a) semantische Kosinus-Ähnlichkeit Top-32 unter Verwendung von mehrsprachigen MiniLM-Einbettungen und (b) Traversierung von kausalen Kanten von denselben Seeds bis zur Tiefe 3. Der semantische Recall betrug 32,1 % (94/293), der kausale Recall 94,5 % (277/293), was einen Graph-Beitrag von +62,5 Prozentpunkten ergibt. Die Autoren betonen, dass das wichtigste Ergebnis nicht die genauen Zahlen sind, sondern das reproduzierbare Muster: Semantische Wortähnlichkeit allein erreicht maximal etwa ein Drittel, während explizite kausale Verknüpfungen den Recall dramatisch steigern. Sie stellen vollständige Gold-Paare und eine 6-Schritte-Methode zur Verfügung, um eine unabhängige Replikation zu ermöglichen. Die Arbeit weist auch auf beiläufige Befunde hin: 143 PRs, die von KI-Agenten (hauptsächlich GitHub Copilot) erstellt wurden, und 173 Revert-PRs, was verdeutlicht, dass Speicherprobleme real sind.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten