Simula: een raamwerk voor het ontwerpen van synthetische datasets op basis van mechanismen en redenering
Google/DeepMind
Google Research introduceert Simula, een raamwerk dat het genereren van synthetische data herdefinieert als het ontwerpen van dataset-mechanismen. Het gebruikt een redeneer-eerst-methodologie om volledige datasets vanuit eerste principes op te bouwen, wat fijnmazige controle biedt over dekking, complexiteit en kwaliteit. Simula is een belangrijke factor geweest voor het Gemma-ecosysteem en veiligheidsclassificaties bij Google.
Google Research heeft Simula geïntroduceerd, een raamwerk voor synthetische datageneratie dat het creëren van datasets benadert als een mechanisme-ontwerpprobleem. In tegenstelling tot bestaande methoden die afhankelijk zijn van handmatige prompts of startdata, gebruikt Simula een redeneer-eerst-benadering, waarbij datasets worden geconstrueerd vanuit eerste principes zonder startdata. Het deelt generatie op in vier assen: diepe taxonomieën voor dekking, lokale diversificatie voor variatie, complexificatie voor moeilijkheidsaanpassing en kwaliteitscontroles via een dual-critic-loop. Simula gebruikt op redenering gebaseerde metrieken zoals taxonomische dekking en Elo-rating voor evaluatie. Het is gebruikt met Gemini 2.5 Flash als leraar en Gemma-3 4B als student in domeinen zoals cybersecurity, juridisch redeneren, wiskunde (GSM8k) en meertalige kennis (Global Multilingual Massive Multitask Language Understanding, Global MMLU). Binnen Google ondersteunt Simula het Gemma-ecosysteem (ShieldGemma, FunctionGemma, MedGemma), veiligheidsclassificatoren voor Gemini, en functies zoals oplichtingsdetectie voor Android-gesprekken en spamfiltering in Google Berichten. Het raamwerk heeft als doel datageneratie tot een beheersbare wetenschap te maken voor gespecialiseerde AI-toepassingen.
Bron: Google Research —
origineel
