연구애플리케이션 🇷🇺 31.07.2026 01:02

외부 인과 회상 벤치마크: 얀덱스 YDB에서 AI 어시스턴트 메모리 테스트

ЯндексЯндекс
오픈소스 YDB 저장소(ydb-platform/ydb)에서 인과 회상 벤치마크를 실행하여 AI 어시스턴트가 유사한 증상에 대한 과거 수정 사항을 얼마나 잘 검색하는지 측정했습니다. 의미 검색만으로는 정확한 PR을 32.1%의 경우에만 찾았지만, 명시적 인과 관계(이슈 -> 해결 PR)를 탐색한 경우 94.5%의 성공률을 보여 그래프가 +62.5% 포인트 기여했습니다. 이러한 패턴은 언어, 도메인 또는 티켓 문화와 관계없이 재현됩니다.
저자들은 공개 ydb-platform/ydb 저장소(10,285개의 이슈, 37,067개의 PR, C++, 영어)에서 인과 관계 재현 벤치마크를 구축했습니다. GitHub의 Closes/Fixes/Resolves #N 패턴을 사용해 골드 쌍을 추출했습니다(ydbot과 github-actions의 봇 PR을 필터링한 후 293개의 유효한 쌍). 각 쿼리(이슈 제목)에 대해 두 가지 검색 방법을 비교했습니다: (a) 다국어 MiniLM 임베딩을 사용한 의미론적 코사인 유사도 상위 32개, (b) 동일한 시드에서 깊이 3까지의 인과 관계 가장자리 탐색. 의미론적 재현율은 32.1%(94/293)였고, 인과 관계 재현율은 94.5%(277/293)로, 그래프 기여도는 +62.5% 포인트였습니다. 저자들은 핵심 결과가 정확한 수치가 아니라 재현 가능한 패턴, 즉 의미론적 단어 유사도만으로는 약 1/3이 최대치인 반면 명시적 인과 관계 링크가 재현율을 크게 향상시킨다는 점이라고 강조합니다. 그들은 전체 골드 쌍과 독립적인 재현을 위한 6단계 방법을 제공합니다. 이 작업은 또한 우연히 발견된 사실로, AI 에이전트(주로 GitHub Copilot)가 생성한 143개의 PR과 173개의 되돌리기 PR을 언급하며, 메모리 문제가 실제로 존재함을 보여줍니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스