RisetAplikasi 🇷🇺 31.07.2026 01:02

Benchmark Ingatan Kausal Eksternal: Menguji Memori Asisten AI pada YDB dari Yandex

ЯндексЯндекс
Sebuah benchmark ingatan kausal dijalankan pada repositori YDB sumber terbuka (ydb-platform/ydb) untuk mengukur seberapa baik asisten AI mengambil kembali perbaikan masa lalu untuk gejala serupa. Pencarian semantik saja menemukan PR yang benar dalam 32,1% kasus, sementara menelusuri tepi kausal eksplisit (masalah -> PR penutup) mencapai 94,5%, menunjukkan kontribusi +62,5 poin persentase dari grafik. Pola ini dapat direplikasi tanpa bergantung pada bahasa, domain, atau budaya tiket.
Para penulis membangun tolok ukur recall kausal pada repositori publik ydb-platform/ydb (10.285 issue, 37.067 PR, C++, bahasa Inggris). Mereka mengekstrak pasangan emas menggunakan pola GitHub Closes/Fixes/Resolves #N (293 pasangan valid setelah menyaring PR bot dari ydbot dan github-actions). Untuk setiap kueri (judul issue), dua metode pengambilan dibandingkan: (a) kemiripan kosinus semantik top-32 menggunakan embedding MiniLM multibahasa, dan (b) penelusuran tepi kausal dari seed yang sama hingga kedalaman 3. Recall semantik adalah 32,1% (94/293), recall kausal adalah 94,5% (277/293), menghasilkan kontribusi grafik sebesar +62,5 poin persentase. Para penulis menekankan bahwa hasil utama bukanlah angka pastinya tetapi pola yang dapat direproduksi: kemiripan kata semantik saja maksimal sekitar sepertiga, sementara tautan kausal eksplisit secara drastis meningkatkan recall. Mereka menyediakan semua pasangan emas dan metode 6 langkah untuk memungkinkan replikasi independen. Pekerjaan ini juga mencatat temuan insidental: 143 PR yang dibuat oleh agen AI (terutama GitHub Copilot) dan 173 PR revert, yang mengilustrasikan bahwa masalah memori adalah nyata.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru