RechercheAgents 🇺🇸 27.07.2026 16:04

ConvApparel : mesurer et combler le fossé de réalisme dans les simulateurs d'utilisateurs basés sur les LLM

Google/DeepMindGoogle/DeepMind
Google Research présente ConvApparel, un nouveau jeu de données de conversations humain-IA et un cadre d'évaluation à trois piliers pour quantifier et réduire le « fossé de réalisme » dans les simulateurs d'utilisateurs basés sur les modèles de langage de grande taille (LLM). Ce cadre comprend des statistiques au niveau de la population, un score de ressemblance humaine et une validation contrefactuelle, appliqués à des simulateurs construits avec les modèles Gemini. Les résultats montrent que les simulateurs basés sur les données (apprentissage en contexte, ICL ; réglage fin supervisé, SFT) surpassent ceux basés sur des instructions, mais que même les meilleurs modèles présentent encore des artefacts synthétiques subtils.
Des chercheurs de Google Research, Ofer Meshi et Sally Goldman, ont présenté ConvApparel, un nouvel ensemble de données et un cadre d'évaluation conçus pour mesurer et améliorer le réalisme des simulateurs d'utilisateurs basés sur des grands modèles de langage (LLM, pour Large Language Models). L'ensemble de données comprend plus de 4 000 conversations humain-IA multi-tours (près de 15 000 tours) dans le domaine du shopping vestimentaire, collectées à l'aide d'un protocole à deux agents où les utilisateurs étaient dirigés aléatoirement vers un agent 'Bon' utile ou un agent 'Mauvais' intentionnellement peu serviable. Le cadre comprend trois piliers : les statistiques au niveau de la population, le score de ressemblance humaine via un discriminateur automatisé et la validation contrefactuelle. En utilisant la famille de modèles Gemini, trois simulateurs ont été testés : une référence basée sur des invites (prompt), un simulateur d'apprentissage en contexte (ICL) avec génération augmentée par récupération, et un simulateur de réglage fin supervisé (SFT). Les résultats ont montré que les simulateurs basés sur les données (ICL et SFT) surpassaient la référence basée sur des invites, imitant de près le comportement humain dans les tests au niveau de la population, mais toutes les conversations simulées ont été identifiées avec confiance comme étant synthétiques par le discriminateur de ressemblance humaine. La validation contrefactuelle a démontré que les simulateurs ICL et SFT pouvaient s'adapter à l'agent 'Mauvais' non vu en montrant une frustration accrue, tandis que la référence basée sur des invites restait anormalement polie. La recherche met en évidence le fossé persistant en matière de réalisme et fournit des outils pour le combler.
Source: Google Research — original
Nos articles précédents sur ce sujet ↓
Infos fraîches