ConvApparel:衡量并缩小基于大语言模型的用户模拟器中的真实感差距
Google/DeepMind
谷歌研究人员推出了 ConvApparel,这是一个用于衡量基于大语言模型的用户模拟器中真实感差距的数据集和评估框架。通过使用包含反事实验证的三组件验证框架,他们表明数据训练的模拟器显著优于简单的基于提示的模拟器,但真实感差距仍然存在。
Google Research представила ConvApparel — новый набор данных и систему оценки для измерения «разрыва в реалистичности» симуляторов пользователей на основе LLM. Современные диалоговые агенты ИИ часто испытывают трудности в длинных взаимодействиях, забывая ограничения или генерируя нерелевантные ответы. Обучение таких систем требует непрерывной обратной связи, но использование живых пользователей дорого и трудно масштабируемо. В качестве альтернативы применяются симуляторы пользователей на основе LLM, однако они страдают от разрыва в реалистичности, проявляя неестественное терпение или энциклопедические знания. ConvApparel включает более 4000 разговоров между людьми и ИИ (около 15000 реплик) в области покупки одежды. Сбор данных велся с использованием двух агентов — полезного («Good») и намеренно бесполезного («Bad»), что позволило зафиксировать широкий спектр человеческих реакций. Для оценки симуляторов разработана трёхкомпонентная система: статистические тесты на уровне популяции, оценка человекоподобия с помощью автоматического дискриминатора и контрфактуальная валидация — симулятор, обученный на хорошем агенте, должен адекватно реагировать на плохого. Три протестированных симулятора (промпт-базированный, ICL, SFT на базе Gemini) показали, что ICL и SFT значительно превосходят промпт-базированный, но даже лучшие SFT-модели создают заметные артефакты. Контрфактуальная валидация выявила, что промпт-базированный симулятор не адаптируется, тогда как ICL и SFT демонстрируют реалистичное раздражение при взаимодействии с плохим агентом. Исследователи подчёркивают, что создание полностью реалистичного симулятора остаётся открытой задачей, а предложенный фреймворк позволяет измерить разрыв, но не определяет необходимую степень реалистичности. ConvApparel предоставлен сообществу для дальнейших исследований.
来源: Google Research —
原文
