Benchmark de Recordação Causal Externa: Testando a Memória do Assistente de IA no YDB da Yandex
Яндекс
Um benchmark de recordação causal foi executado no repositório open-source YDB (ydb-platform/ydb) para medir quão bem um assistente de IA recupera correções passadas para sintomas semelhantes. Apenas a busca semântica encontrou o PR correto em 32,1% dos casos, enquanto a travessia de arestas causais explícitas (problema -> PR de fechamento) alcançou 94,5%, mostrando uma contribuição de +62,5 pontos percentuais do grafo. O padrão se replica independentemente de idioma, domínio ou cultura de tickets.
Os autores construíram um benchmark de recall causal no repositório público ydb-platform/ydb (10.285 issues, 37.067 PRs, C++, inglês). Eles extraíram pares dourados usando o padrão do GitHub Closes/Fixes/Resolves #N (293 pares válidos após filtrar PRs de bots de ydbot e github-actions). Para cada consulta (título da issue), dois métodos de recuperação foram comparados: (a) similaridade semântica de cosseno top-32 usando embeddings MiniLM multilíngues, e (b) travessia de arestas causais a partir das mesmas sementes até a profundidade 3. O recall semântico foi de 32,1% (94/293), o recall causal foi de 94,5% (277/293), resultando em uma contribuição do grafo de +62,5 pontos percentuais. Os autores enfatizam que o resultado chave não são os números exatos, mas o padrão reproduzível: a similaridade semântica de palavras sozinha atinge no máximo um terço, enquanto links causais explícitos aumentam drasticamente o recall. Eles fornecem todos os pares dourados e um método de 6 etapas para permitir replicação independente. O trabalho também observa descobertas incidentais: 143 PRs criados por agentes de IA (principalmente GitHub Copilot) e 173 PRs de reversão, ilustrando que problemas de memória são reais.
Fonte: Habr — хаб ИИ —
original
