Поймали ИИ-агента на вранье — его же памятью
Разработчики системы семантической памяти vecmory для ИИ-агентов обнаружили два случая, когда агент сам себя остановил перед ложным отчётом благодаря извлечению записей из собственной памяти. Первый случай: агент чуть не одобрил роутер, показавший корреляцию 0.98 на синтетике, но память напомнила, что на реальных данных идея провалилась. Второй: агент отключил свою же фичу с «важностью» узлов, так как она ухудшила ранжирование (MRR упал с 0.81 до 0.41).
Команда разработчиков vecmory, системы семантической памяти для ИИ-агентов, описала два реальных случая, когда агент, используя собственную память, предотвратил принятие неверных решений. В первом случае агент предложил улучшить ранжирование с помощью роутера, который на синтетическом бенчмарке показал корреляцию 0.98. Перед отчётом он выполнил recall и извлёк запись из прошлой сессии, где эта же идея провалилась на реальных данных. Проблема заключалась в том, что синтетические эмбеддинги модели MiniLM дают искусственно низкий базовый косинус (0.00±0.08 для случайных пар), тогда как на реальном корпусе памяти (246 узлов) случайные пары имеют косинус в среднем 0.53, а соседи — 0.80, с перекрытием распределений. Поэтому абсолютный порог с синтетики неприменим — нужно ранжировать по top-k. Во втором случае агент отключил свою же фичу — добавление «важности» узла (входящей степени) в ранжирование. Измерения на реальных парах показали, что чистый косинус даёт MRR 0.81, а бленд с важностью — только 0.41, так как глобальная популярность топит точные редкие факты. На синтетическом графе с хабами ситуация обратная: важность улучшает MRR с 0.033 до 1.0. Команда пришла к выводу, что единого статического веса нет, и оставила чистый косинус по умолчанию, вынеся графовый метод как опцию. Кроме того, на основе анализа закрытых PR был обнаружен сигнал «повторных правок» (revert — 39 раз, xsrf — за 60) — выстраданное знание, которое теперь подмешивается первым блоком в каждый recall. В итоге авторы отмечают, что ценность памяти не в подтверждении удобного, а в способности возразить автору, и что агент с памятью отличается умением поймать себя на «bingo!» до отчёта. На GitHub-тикетах (4299 узлов, 300 запросов) причинный обход графа даёт 87% точности против 38% у чистого косинуса.
- Сокращения
- PR = Pull Request — запрос на слияние
- MRR = Mean Reciprocal Rank — средний обратный ранг
- PPR = Personalized PageRank — персонализированный PageRank
Источник: Habr — хаб ИИ —
оригинал
