Simula: um Framework para Projetar Conjuntos de Dados Sintéticos Baseados em Mecanismos e Raciocínio
Google/DeepMind
O Google Research apresenta o Simula, um framework que reformula a geração de dados sintéticos como design de mecanismos em nível de conjunto de dados. Ele utiliza uma metodologia baseada em raciocínio para construir conjuntos de dados completos a partir de primeiros princípios, permitindo controle refinado sobre cobertura, complexidade e qualidade. O Simula tem sido um facilitador chave para o ecossistema Gemma e classificadores de segurança no Google.
O Google Research introduziu o Simula, uma estrutura para geração de dados sintéticos que trata a criação de conjuntos de dados como um problema de design de mecanismos. Diferentemente de métodos existentes que dependem de prompts manuais ou dados de sementes, o Simula emprega uma abordagem centrada no raciocínio, construindo conjuntos de dados a partir de primeiros princípios, sem sementes. Ele decompõe a geração em quatro eixos: taxonomias profundas para cobertura, diversificação local para variedade, complexificação para ajuste de dificuldade e verificações de qualidade por meio de um loop de crítico duplo. O Simula usa métricas baseadas em raciocínio, como Cobertura Taxonômica e classificações Elo, para avaliação. Ele tem sido utilizado com o Gemini 2.5 Flash como professor e o Gemma-3 4B como aluno em domínios como cibersegurança, raciocínio jurídico, matemática (GSM8k) e conhecimento multilíngue (Global MMLU). Dentro do Google, o Simula alimenta o ecossistema Gemma (ShieldGemma, FunctionGemma, MedGemma), classificadores de segurança para o Gemini e recursos como detecção de golpes em chamadas do Android e filtragem de spam no Google Mensagens. A estrutura visa tornar a geração de dados uma ciência controlável para aplicações de IA especializadas.
Fonte: Google Research —
original
