Pesquisa 🇺🇸 27.07.2026 16:04

ConvApparel: Medindo e Fechando a Lacuna de Realismo em Simuladores de Usuário Baseados em LLMs

Google/DeepMindGoogle/DeepMind
Pesquisadores do Google apresentaram o ConvApparel, um conjunto de dados e estrutura de avaliação para medir a lacuna de realismo em simuladores de usuário baseados em LLMs. Usando um framework de validação de três componentes, incluindo validação contrafactual, eles mostraram que simuladores treinados com dados superam significativamente aqueles baseados em prompts simples, mas uma lacuna de realismo permanece.
Google Research представила ConvApparel — новый набор данных и систему оценки для измерения «разрыва в реалистичности» симуляторов пользователей на основе LLM. Современные диалоговые агенты ИИ часто испытывают трудности в длинных взаимодействиях, забывая ограничения или генерируя нерелевантные ответы. Обучение таких систем требует непрерывной обратной связи, но использование живых пользователей дорого и трудно масштабируемо. В качестве альтернативы применяются симуляторы пользователей на основе LLM, однако они страдают от разрыва в реалистичности, проявляя неестественное терпение или энциклопедические знания. ConvApparel включает более 4000 разговоров между людьми и ИИ (около 15000 реплик) в области покупки одежды. Сбор данных велся с использованием двух агентов — полезного («Good») и намеренно бесполезного («Bad»), что позволило зафиксировать широкий спектр человеческих реакций. Для оценки симуляторов разработана трёхкомпонентная система: статистические тесты на уровне популяции, оценка человекоподобия с помощью автоматического дискриминатора и контрфактуальная валидация — симулятор, обученный на хорошем агенте, должен адекватно реагировать на плохого. Три протестированных симулятора (промпт-базированный, ICL, SFT на базе Gemini) показали, что ICL и SFT значительно превосходят промпт-базированный, но даже лучшие SFT-модели создают заметные артефакты. Контрфактуальная валидация выявила, что промпт-базированный симулятор не адаптируется, тогда как ICL и SFT демонстрируют реалистичное раздражение при взаимодействии с плохим агентом. Исследователи подчёркивают, что создание полностью реалистичного симулятора остаётся открытой задачей, а предложенный фреймворк позволяет измерить разрыв, но не определяет необходимую степень реалистичности. ConvApparel предоставлен сообществу для дальнейших исследований.
Fonte: Google Research — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas