ИсследованияАгенты 🇺🇸 20.07.2026 09:04

ConvApparel: измерение и устранение разрыва реалистичности в симуляторах пользователей на основе LLM

Google/DeepMindGoogle/DeepMind
Исследователи Google представили ConvApparel — новый набор данных для оценки разрыва реалистичности LLM-симуляторов пользователей. Разработана трёхкомпонентная система валидации, включающая традиционные тесты, оценку «человекоподобия» и контрафактуальную валидацию. Данные симуляторы (особенно обученные на примерах) лучше адаптируются к незнакомым агентам, чем простые промпт-симуляторы.
Команда Google Research представила ConvApparel — новый набор данных и систему оценки для измерения «разрыва реалистичности» в LLM-симуляторах пользователей. Исследователи отмечают, что современные LLM-симуляторы часто ведут себя нетипично: чрезмерно терпеливы, многословны или обладают нереалистичными знаниями. Чтобы количественно оценить этот разрыв, была создана коллекция из более чем 4000 диалогов между людьми и AI-агентами в сфере покупки одежды. Ключевая особенность — участников случайным образом направляли к «хорошему» или «плохому» агенту, что позволило собрать данные о широком спектре реакций. Для оценки симуляторов разработана трёхкомпонентная система: стандартное статистическое сравнение с поведением людей, автоматический классификатор «человекоподобности» (человек vs симулятор) и контрафактуальная валидация (обучение на «хорошем» агенте и тест на «плохом»). В экспериментах сравнивались три симулятора на базе Gemini: промпт-симулятор, симулятор с in-context learning (ICL) и симулятор с supervised fine-tuning (SFT). Оказалось, что SFT-симулятор лучше всех воспроизводит человеческое поведение, но даже он обнаруживает артефакты — «слишком идеальную» речь. Промпт-симулятор не смог адаптироваться к «плохому» агенту, оставаясь неестественно вежливым. ICL и SFT симуляторы, напротив, продемонстрировали реалистичный рост разочарования и снижение удовлетворённости при взаимодействии с «плохим» агентом, хотя никогда не видели его в обучающих данных. Работа показала сохраняющийся разрыв реалистичности и важность контрафактуальной валидации для проверки способности симулятора адаптироваться к новым сценариям.
Сокращения
LLM = Large Language Model — большая языковая модель
ICL = In-Context Learning — обучение в контексте
SFT = Supervised Fine-Tuning — обучение с учителем с донастройкой
Источник: Google Research — оригинал

Наши прошлые публикации по теме

Есть свежие новости