Внешний бенчмарк каузального вспоминания: тестирование памяти ИИ-ассистента на YDB от Яндекса
Был проведен бенчмарк каузального вспоминания на открытом репозитории YDB (ydb-platform/ydb), чтобы измерить, насколько хорошо ИИ-ассистент извлекает прошлые исправления для аналогичных симптомов. Только семантический поиск нашел правильный PR в 32,1% случаев, в то время как обход явных каузальных ребер (issue -> закрывающий PR) достиг 94,5%, что показывает вклад графа в +62,5 процентных пункта. Закономерность воспроизводится независимо от языка, предметной области или культуры оформления заявок.
Авторы построили бенчмарк для оценки каузального поиска на публичном репозитории ydb-platform/ydb (10 285 задач, 37 067 PR, C++, английский язык). Они извлекли пары «золотого стандарта», используя шаблон GitHub Closes/Fixes/Resolves #N (293 валидные пары после фильтрации ботов ydbot и github-actions). Для каждого запроса (заголовок задачи) сравнивались два метода поиска: (a) топ-32 по
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
