Simula: Un Marco para el Diseño de Conjuntos de Datos Sintéticos Basado en Mecanismos y Razonamiento
Google/DeepMind
Google Research presenta Simula, un marco que reformula la generación de datos sintéticos como diseño de mecanismos a nivel de conjunto de datos. Utiliza una metodología de razonamiento primero para construir conjuntos de datos completos a partir de primeros principios, lo que permite un control preciso sobre la cobertura, la complejidad y la calidad. Simula ha sido un habilitador clave para el ecosistema Gemma y los clasificadores de seguridad en Google.
Google Research ha presentado Simula, un marco de generación de datos sintéticos que trata la creación de conjuntos de datos como un problema de diseño de mecanismos. A diferencia de los métodos existentes que dependen de instrucciones manuales o datos semilla, Simula emplea un enfoque basado en el razonamiento, construyendo conjuntos de datos desde primeros principios sin semillas. Descompone la generación en cuatro ejes: taxonomías profundas para la cobertura, diversificación local para la variedad, complejización para el ajuste de dificultad y controles de calidad mediante un bucle de doble crítico. Simula utiliza métricas basadas en razonamiento como Cobertura Taxonómica y valoraciones Elo para la evaluación. Se ha usado con Gemini 2.5 Flash como profesor y Gemma-3 4B como estudiante en ámbitos como ciberseguridad, razonamiento jurídico, matemáticas (GSM8k) y conocimiento multilingüe (Global MMLU). Dentro de Google, Simula impulsa el ecosistema Gemma (ShieldGemma, FunctionGemma, MedGemma), clasificadores de seguridad para Gemini y funciones como la detección de estafas en llamadas de Android y el filtrado de spam en Google Messages. El marco busca convertir la generación de datos en una ciencia controlable para aplicaciones especializadas de inteligencia artificial.
Fuente: Google Research —
original
