ConvApparel: Medindo e Fechando a Lacuna de Realismo em Simuladores de Usuário Baseados em LLM
Google/DeepMind
O Google Research apresenta o ConvApparel, um novo conjunto de dados de conversa humano-IA e uma estrutura de avaliação de três pilares para quantificar e reduzir a 'lacuna de realismo' em simuladores de usuário baseados em LLM. A estrutura inclui estatísticas no nível da população, pontuação de semelhança humana e validação contrafactual, aplicada a simuladores construídos com modelos Gemini. Os resultados mostram que simuladores orientados por dados (ICL, SFT) superam aqueles baseados em prompts, mas mesmo os melhores modelos ainda exibem artefatos sintéticos sutis.
Os pesquisadores do Google Research, Ofer Meshi e Sally Goldman, apresentaram o ConvApparel, um novo conjunto de dados e estrutura de avaliação projetados para medir e melhorar o realismo de simuladores de usuário baseados em LLM. O conjunto de dados compreende mais de 4.000 conversas humano-IA de múltiplas interações (quase 15.000 turnos) no domínio de compras de vestuário, coletadas usando um protocolo de duplo agente onde os usuários eram encaminhados aleatoriamente para um agente útil 'Bom' ou um agente intencionalmente pouco útil 'Ruim'. A estrutura inclui três pilares: estatísticas em nível populacional, pontuação de similaridade humana por meio de um discriminador automatizado e validação contrafactual. Usando a família de modelos Gemini, três simuladores foram testados: uma linha de base baseada em prompt, um simulador de aprendizado no contexto (in-context learning, ICL) com geração aumentada por recuperação (retrieval-augmented generation, RAG) e um simulador de ajuste fino supervisionado (supervised fine-tuning, SFT). Os resultados mostraram que os simuladores baseados em dados (ICL e SFT) superaram a linha de base baseada em prompt, aproximando-se bastante do comportamento humano nos testes em nível populacional, mas todas as conversas simuladas foram identificadas com confiança como sintéticas pelo discriminador de similaridade humana. A validação contrafactual demonstrou que os simuladores ICL e SFT puderam se adaptar ao agente 'ruim' não visto, mostrando frustração crescente, enquanto a linha de base baseada em prompt permaneceu artificialmente educada. A pesquisa destaca a lacuna persistente de realismo e fornece ferramentas para superá-la.
Fonte: Google Research —
original
