Simula: Kehys synteettisten tietoaineistojen suunnitteluun mekanismien ja päättelyn avulla
Google/DeepMind
Google Research esittelee Simulan, kehyksen, joka määrittelee synteettisen datan tuottamisen uudelleen tietoaineistotason mekanismisuunnitteluna. Se käyttää päättelyä ensisijaisena menetelmänä rakentaakseen kokonaisia tietoaineistoja ensimmäisistä periaatteista lähtien, mahdollistaen hienojakoisen hallinnan kattavuuden, monimutkaisuuden ja laadun suhteen. Simula on ollut keskeinen mahdollistaja Gemma-ekosysteemille ja Googlen turvallisuusluokittimille.
Google Research on esitellyt Simulan, synteettisen datan tuottamiseen tarkoitetun kehyksen, joka käsittelee datasetin luomista mekanismisuunnittelun ongelmana. Toisin kuin olemassa olevat menetelmät, jotka perustuvat manuaalisiin kehotteisiin tai siemenaineistoon, Simula käyttää ensin päättelyä -menetelmää, rakentaen datasetit ensimmäisistä periaatteista ilman siemenaineistoa. Se jakaa generoinnin neljään akseliin: syvät taksonomiat kattavuuden varmistamiseksi, paikallinen monipuolistaminen vaihtelun lisäämiseksi, kompleksointi vaikeustason säätämiseksi ja laaduntarkistukset kaksoiskriitikkosilmukalla. Simula käyttää päättelypohjaisia mittareita, kuten taksonomista kattavuutta ja Elo-luokituksia arviointiin. Sitä on käytetty Gemini 2.5 Flashin toimiessa opettajana ja Gemma-3 4B:n oppilaana eri aloilla, kuten kyberturvallisuudessa, oikeudellisessa päättelyssä, matematiikassa (GSM8k) ja monikielisessä tietämyksessä (Global MMLU). Googlen sisällä Simula tukee Gemma-ekosysteemiä (ShieldGemma, FunctionGemma, MedGemma), Gemini-turvaluokittimia sekä ominaisuuksia, kuten Android-puheluiden huijaustunnistusta ja Googlen Messages-sovelluksen roskapostisuodatusta. Kehyksen tavoitteena on tehdä datan tuottamisesta hallittava tiede erikoistuneisiin tekoälysovelluksiin.
Lähde: Google Research —
Alkuperäinen
