OnderzoekAgenten 🇺🇸 27.07.2026 16:04

ConvApparel: het meten en dichten van de realiteitskloof in LLM-gesimuleerde gebruikers

Google/DeepMindGoogle/DeepMind
Google Research introduceert ConvApparel, een nieuwe mens-AI-gespreksdataset en een driepijler-evaluatieframework om de 'realiteitskloof' in LLM-gebaseerde gebruikerssimulatoren te kwantificeren en te verkleinen. Het framework omvat populatiestatistieken, menselijkheidsscores en tegenfeitelijke validatie, toegepast op simulatoren gebouwd met Gemini-modellen. De resultaten tonen aan dat datagestuurde simulatoren (ICL, SFT) beter presteren dan promptgebaseerde, maar zelfs de beste modellen vertonen nog subtiele synthetische artefacten.
Onderzoekers van Google Research, Ofer Meshi en Sally Goldman, hebben ConvApparel geïntroduceerd, een nieuwe dataset en evaluatiekader ontworpen om de realisme van LLM-gebaseerde gebruikerssimulators te meten en te verbeteren. De dataset bevat meer dan 4.000 mens-AI multi-turn gesprekken (bijna 15.000 beurten) in het domein van kledingwinkelen, verzameld met behulp van een dual-agent protocol waarbij gebruikers willekeurig werden doorgestuurd naar een behulpzame 'Goede' agent of een opzettelijk onbehulpzame 'Slechte' agent. Het kader omvat drie pijlers: populatie-niveau statistieken, menselijkheids-score via een geautomatiseerde discriminator, en tegenfeitelijke validatie. Met behulp van de Gemini-modelfamilie werden drie simulators getest: een baseline met prompts, een in-context learning (ICL) simulator met retrieval-augmented generation, en een supervised fine-tuning (SFT) simulator. Resultaten toonden aan dat datagestuurde simulators (ICL en SFT) beter presteerden dan de baseline met prompts, waarbij ze menselijk gedrag op populatie-niveau tests nauw benaderden, maar alle gesimuleerde gesprekken werden met zekerheid als synthetisch geïdentificeerd door de menselijkheids-discriminator. Tegenfeitelijke validatie toonde aan dat ICL- en SFT-simulators zich konden aanpassen aan de onbekende 'slechte' agent door meer frustratie te tonen, terwijl de baseline met prompts onnatuurlijk beleefd bleef. Het onderzoek benadrukt de aanhoudende realisme-kloof en biedt hulpmiddelen om deze te overbruggen.
Bron: Google Research — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws