研究媒体生成 🇺🇸 27.07.2026 15:05

Simula:基于机制与推理设计合成数据集的新框架

Google/DeepMindGoogle/DeepMind
Google Research 推出 Simula 框架,该框架将合成数据生成重新定义为数据集层面的机制设计。它采用推理优先的方法,从基本原理出发构建完整数据集,从而实现对数据集覆盖范围、复杂度和质量的精细控制。Simula 已成为 Google 内部 Gemma 生态系统及安全分类器的重要支撑。
Google Research 推出了 Simula,这是一个将数据集创建视为机制设计问题的合成数据生成框架。与依赖手动提示或种子数据的现有方法不同,Simula 采用了一种优先推理的方法,在不使用种子数据的情况下从第一性原理构建数据集。它将生成过程分解为四个维度:用于覆盖的深度分类法、用于多样性的局部多样化、用于难度调整的复杂化,以及通过双批评循环进行的质量检查。Simula 使用基于推理的衡量标准,如分类法覆盖率和 Elo 评分(一种基于对战胜负的评分系统,首次使用需解释)进行评估。它已与 Gemini 2.5 Flash(作为教师模型)和 Gemma-3 4B(作为学生模型)配合使用,应用于网络安全、法律推理、数学(GSM8k 数据集)和多语言知识(Global MMLU 基准测试)等领域。在 Google 内部,Simula 为 Gemma 生态系统(ShieldGemma、FunctionGemma、MedGemma)、Gemini 的安全分类器以及 Android 电话诈骗检测和 Google Messages 垃圾邮件过滤等功能提供支持。该框架旨在使数据生成成为面向专业人工智能应用的可控科学。
来源: Google Research — 原文
我们之前关于此话题的帖子 ↓
最新新闻