InvestigaciónAgentes 🇺🇸 27.07.2026 16:04

ConvApparel: Midiendo y Cerrando la Brecha de Realismo en Simuladores de Usuario Basados en LLM

Google/DeepMindGoogle/DeepMind
Google Research presenta ConvApparel, un nuevo conjunto de datos de conversación humano-IA y un marco de evaluación de tres pilares para cuantificar y reducir la 'brecha de realismo' en simuladores de usuario basados en LLM. El marco incluye estadísticas a nivel de población, puntuación de similitud humana y validación contrafactual, aplicado a simuladores construidos con modelos Gemini. Los resultados muestran que los simuladores basados en datos (ICL, SFT) superan a los basados en indicaciones, pero incluso los mejores modelos aún presentan sutiles artefactos sintéticos.
Investigadores de Google Research, Ofer Meshi y Sally Goldman, presentaron ConvApparel, un nuevo conjunto de datos y marco de evaluación diseñado para medir y mejorar el realismo de los simuladores de usuarios basados en LLM. El conjunto de datos comprende más de 4000 conversaciones humano-IA de múltiples turnos (casi 15 000 turnos) en el dominio de compras de ropa, recopiladas mediante un protocolo de doble agente en el que los usuarios fueron enrutados aleatoriamente a un agente 'Bueno' útil o a un agente 'Malo' intencionalmente poco útil. El marco incluye tres pilares: estadísticas a nivel de población, puntuación de similitud humana mediante un discriminador automatizado y validación contrafáctica. Utilizando la familia de modelos Gemini, se probaron tres simuladores: una línea base con indicaciones, un simulador de aprendizaje en contexto (ICL, por sus siglas en inglés) con generación aumentada por recuperación, y un simulador de ajuste fino supervisado (SFT, por sus siglas en inglés). Los resultados mostraron que los simuladores basados en datos (ICL y SFT) superaron a la línea base con indicaciones, reflejando de cerca el comportamiento humano en las pruebas a nivel de población, pero todas las conversaciones simuladas fueron identificadas con confianza como sintéticas por el discriminador de similitud humana. La validación contrafáctica demostró que los simuladores ICL y SFT podían adaptarse al agente 'Malo' no visto mostrando mayor frustración, mientras que la línea base con indicaciones se mantenía artificialmente educada. La investigación destaca la brecha persistente de realismo y proporciona herramientas para cerrarla.
Fuente: Google Research — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas