TutkimusAgentit 🇺🇸 27.07.2026 16:04

ConvApparel: LLM-pohjaisten käyttäjäsimulaattorien realismikuilun mittaaminen ja sulkeminen

Google/DeepMindGoogle/DeepMind
Google Research esittelee ConvApparel-nimisen uuden ihmisen ja tekoälyn välisen keskustelutietojoukon ja kolmen pilarin arviointikehyksen, joka mittaa ja vähentää 'realismikuilua' LLM-pohjaisissa käyttäjäsimulaattoreissa. Kehys sisältää populaatiotason tilastot, ihmismäisyyden pisteytyksen ja kontrafaktuaalisen validoinnin, ja sitä sovelletaan Gemini-mallien avulla rakennettuihin simulaattoreihin. Tulokset osoittavat, että datavetoiset simulaattorit (ICL, SFT) suoriutuvat paremmin kuin kehotepohjaiset, mutta parhaissakin malleissa on edelleen hienovaraisia synteettisiä artefakteja.
Google Researchin tutkijat Ofer Meshi ja Sally Goldman esittelivät ConvApparelin, uuden tietoaineiston ja arviointikehyksen, joka on suunniteltu mittaamaan ja parantamaan LLM-pohjaisten käyttäjäsilmulaattoreiden realistisuutta. Tietoaineisto koostuu yli 4 000 ihmisen ja tekoälyn välisestä monivaiheisesta keskustelusta (lähes 15 000 vuoroa) vaateostoskontekstissa, jotka kerättiin kaksoisagenttiprotokollalla, jossa käyttäjät ohjattiin satunnaisesti joko avuliaaseen 'hyvään' agenttiin tai tarkoituksella epäavuliaaseen 'huonoon' agenttiin. Kehys sisältää kolme pilaria: populaatiotason tilastot, ihmismäisyyden pisteytys automaattisella erottelijalla ja kontrafaktuaalinen validointi. Gemini-malliperhettä käyttäen testattiin kolmea silmulaattoria: kehotteella toimiva perustaso, kontekstioppimista (ICL) käyttävä silmulaattori, jossa on täydennyshakuinen generointi, ja ohjattu hienosäätö (SFT) -silmulaattori. Tulokset osoittivat, että dataohjatut silmulaattorit (ICL ja SFT) suoriutuivat kehotteella toimivaa perustasoa paremmin ja jäljittelivät tarkasti ihmiskäyttäytymistä populaatiotason testeissä, mutta kaikki silmuloidut keskustelut tunnistettiin luotettavasti synteettisiksi ihmismäisyyden erottelijan toimesta. Kontrafaktuaalinen validointi osoitti, että ICL- ja SFT-silmulaattorit pystyivät sopeutumaan ennalta näkemättömään 'huonoon' agenttiin osoittamalla lisääntynyttä turhautumista, kun taas kehotteella toimiva perustaso pysyi luonnottoman kohteliaana. Tutkimus korostaa jatkuvaa realistisuuskuilua ja tarjoaa työkaluja sen kuromiseksi umpeen.
Lähde: Google Research — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset