外部因果回忆基准测试:在Yandex的YDB上评估AI助手的记忆能力
Яндекс
一个因果回忆基准测试在开源YDB代码库(ydb-platform/ydb)上运行,用于衡量AI助手在遇到类似症状时检索过去修复方案的能力。仅凭语义搜索时,正确关联到相关拉取请求(PR)的准确率为32.1%,而通过遍历显式因果边(从问题到关闭该问题的PR)则达到了94.5%,这表明因果图带来了62.5个百分点的提升。该模式在不同语言、领域或工单文化下均保持稳定。
作者在公开的ydb-platform/ydb代码库(10,285个问题,37,067个拉取请求,C++,英语)上构建了一个因果回忆基准。他们利用GitHub上Closes/Fixes/Resolves #N的模式提取了黄金配对(在过滤掉来自ydbot和github-actions的机器人拉取请求后,得到293个有效配对)。对于每个查询(问题标题),比较了两种检索方法:(a)使用多语言MiniLM嵌入的语义余弦相似度top-32,以及(b)从相同种子开始遍历因果边直到深度3。语义回忆率为32.1%(94/293),因果回忆率为94.5%(277/293),从而得出图贡献为+62.5个百分点。作者强调,关键结果不是确切的数字,而是可复现的模式:仅凭语义词语相似度最多只能达到约三分之一,而显式因果链接能显著提升回忆率。他们提供了完整的黄金配对和6步方法,以便独立复现。该工作还注意到一些附带发现:143个由AI代理(主要是GitHub Copilot)创建的拉取请求和173个回滚拉取请求,这表明记忆问题确实存在。
来源: Habr — хаб ИИ —
原文
