Simula: 메커니즘과 추론 기반 합성 데이터셋 설계를 위한 프레임워크
Google/DeepMind
Google Research가 Simula를 소개합니다. 이 프레임워크는 합성 데이터 생성을 데이터셋 수준의 메커니즘 설계로 재구성합니다. 추론 우선 방법론을 사용하여 데이터셋 전체를 기본 원칙부터 구축함으로써, 적용 범위, 복잡성 및 품질에 대한 세밀한 제어를 가능하게 합니다. Simula는 Google의 Gemma 생태계 및 안전 분류기의 핵심 요소였습니다.
Google Research가 Simula를 소개했습니다. 이는 데이터셋 생성을 메커니즘 설계 문제로 다루는 합성 데이터 생성 프레임워크입니다. 수동 프롬프트나 시드 데이터에 의존하는 기존 방법과 달리, Simula는 추론 우선 접근법을 채택하여 시드 없이 기본 원칙에서 데이터셋을 구축합니다. 생성을 네 가지 축으로 분해합니다: 커버리지를 위한 심층 분류 체계, 다양성을 위한 로컬 다양화, 난이도 조정을 위한 복잡화, 이중 비평가 루프를 통한 품질 검증입니다. Simula는 Taxonomic Coverage와 Elo 등급 같은 추론 기반 메트릭을 평가에 사용합니다. 교사 모델로 Gemini 2.5 Flash, 학생 모델로 Gemma-3 4B를 사용하여 사이버 보안, 법적 추론, 수학(GSM8k), 다국어 지식(Global MMLU) 등 다양한 도메인에서 활용되었습니다. Google 내에서 Simula는 Gemma 생태계(ShieldGemma, FunctionGemma, MedGemma), Gemini의 안전 분류기, Android 통화 사기 탐지 및 Google Messages의 스팸 필터링 같은 기능을 지원합니다. 이 프레임워크는 데이터 생성을 특화된 AI 애플리케이션을 위한 제어 가능한 과학으로 만드는 것을 목표로 합니다.
출처: Google Research —
원문
