Google DiffusionGemma: 기술 보고서가 빠른 텍스트 확산 모델을 설명하다
Google/DeepMind
NVIDIA
Google DeepMind가 DiffusionGemma에 대한 기술 보고서를 발표했습니다. 이 텍스트 확산 모델은 256개의 토큰을 병렬로 생성하며, Nvidia H100에서 초당 약 1,500개의 토큰을 처리합니다. 이 모델은 기존 Gemma 4 모델을 확산 모델로 변환하여 만들어졌으며, 원래 훈련 토큰 예산의 10% 미만을 사용했습니다. 보고서는 자기 교정과 같은 모델의 강점과 추론 및 다중 사용자 처리량의 한계를 강조합니다.
Google DeepMind가 DiffusionGemma에 대한 기술 보고서를 발표했습니다. 이 모델은 6월 중순에 공개된 것으로, 노이즈에서 이미지를 생성하듯 256개 토큰 블록을 병렬로 정제하여 텍스트를 생성합니다. Nvidia H100 가속기에서 초당 약 1,500토큰을 처리합니다. DiffusionGemma는 처음부터 새로 훈련하는 대신 기존 Gemma-4-26B-A4B 모델을 원래 훈련 토큰 예산의 10% 미만으로 확산 모델로 변환했습니다. 훈련은 두 단계로 진행되었습니다. 첫 번째는 노이즈가 있는 텍스트 블록을 재구성하는 학습이고, 두 번째는 강화 학습과 샘플러 증류를 결합한 단계로, Google은 이를 SD·RL이라고 부릅니다. 보고서에 따르면 이 방식은 추론 벤치마크 점수를 평균 10점 향상시키고, 단계당 토큰 수를 거의 4배로 늘리며, 응답 길이를 약 50% 단축합니다. DiffusionGemma의 양방향 처리는 출력 전에 자체 수정을 가능하게 하여, 미세 조정 후 스도쿠 퍼즐을 85% 정확도로 풀 수 있게 합니다(기본 모델은 실패). 또한 단어 단위 생성도 지원하여 사용자가 모드를 전환할 수 있습니다. 그러나 절대 성능은 사후 변환과 속도 중심의 짧은 훈련 단계 등의 이유로 자기회귀 모델보다 낮습니다. 이 모델은 때때로 반복 루프에 빠지거나 추론 섹션을 닫지 못해 벤치마크 점수가 낮아질 수 있습니다. 속도 이점은 주로 단일 사용자 시나리오에 국한되며, 동시 요청이 32개를 넘으면 자기회귀 모델이 처리량에서 따라잡습니다. Google은 DiffusionGemma를 실험적인 모델로 포지셔닝하며, 연구를 가속화하고 특수 적응의 기반을 제공하는 것을 목표로 합니다. 이미 스타트업 Interfaze에서 다국어 음성 인식에 사용되고 있으며, 인터랙티브 방사선 보고서 프로젝트에서도 활용되고 있습니다. 모델은 Apache 2.0 라이선스로 Hugging Face에서 제공되며, 전구체인 Gemini Diffusion은 2025년 5월에 시연되었습니다.
출처: The Decoder (DE) —
원문
