Simula:メカニズムと推論に基づく合成データセット設計のフレームワーク
Google/DeepMind
Google ResearchはSimulaを発表しました。これは合成データ生成をデータセットレベルのメカニズム設計として捉え直すフレームワークです。推論優先の方法論を用いて、第一原理からデータセット全体を構築し、カバレッジ、複雑さ、品質を細かく制御できます。SimulaはGemmaエコシステムやGoogleのセーフティ分類器の主要な実現要因となっています。
Google Researchは、データセット作成をメカニズムデザイン問題として捉える合成データ生成フレームワーク「Simula」を発表しました。手動プロンプトやシードデータに依存する既存手法とは異なり、Simulaは推論優先アプローチを採用し、シードなしで第一原理からデータセットを構築します。生成プロセスを4つの軸に分解します。すなわち、網羅性を担保する深いタクソノミ、多様性を確保する局所的多様化、難易度調整のための複雑化、そしてデュアルクリティカループによる品質チェックです。Simulaは評価のために、タクソノミックカバレッジ(Taxonomic Coverage)やイロレーティング(Elo ratings)といった推論ベースの指標を使用します。本フレームワークは、サイバーセキュリティ、法的推論、数学(GSM8k)、多言語知識(Global MMLU)などの領域において、教師としてGemini 2.5 Flash、生徒としてGemma-3 4Bを用いて活用されています。Google社内では、SimulaはGemmaエコシステム(ShieldGemma、FunctionGemma、MedGemma)、Gemini向けセーフティ分類器、Android通話における詐欺検出やGoogleメッセージのスパムフィルタリングなどの機能を支えています。本フレームワークは、データ生成を特殊化されたAIアプリケーション向けの制御可能な科学とすることを目的としています。
出典: Google Research —
原文
