모델오픈 소스 🇺🇸 27.07.2026 12:02

DiffusionGemma: 텍스트 생성 4배 빠르게

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind가 DiffusionGemma를 발표했습니다. 이는 실험적인 오픈 26B MoE(Mixture of Experts) 모델로, 텍스트 확산을 사용하여 GPU에서 자기회귀 LLM보다 최대 4배 빠르게 생성합니다. 256-토큰 블록을 동시에 처리하며, 인라인 편집과 같은 속도가 중요한 로컬 워크플로우를 대상으로 합니다. Apache 2.0 라이선스로 Hugging Face에 공개되었습니다.
Google DeepMind이 DiffusionGemma를 출시했습니다. 이 실험적인 26B 파라미터 MoE(Mixture of Experts) 모델은 Apache 2.0 라이선스로 제공되며, 순차적 토큰 예측 대신 확산 기반 접근법을 사용하여 최대 4배 빠른 텍스트 생성이 가능합니다. 이 모델은 추론당 3.8B 파라미터만 활성화하며, 양자화 시 18GB VRAM에 적합하고 NVIDIA H100에서 초당 1000개 이상의 토큰, GeForce RTX 5090에서 700개 이상의 토큰을 생성합니다. 양방향 어텐션을 사용해 256개의 토큰을 병렬로 생성하므로, 코드 채우기나 스도쿠 풀기와 같은 비선형 작업이 가능합니다. DiffusionGemma는 로컬 저동시성 추론에 최적화되어 병렬 디코딩의 이점을 극대화하며, 반면 고QPS(Queries Per Second) 클라우드 서빙에서는 자기회귀 모델이 더 나은 성능을 보입니다. 이 모델은 출력을 반복적으로 개선하며, Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo 등의 도구로 미세 조정이 가능하며, llama.cpp 지원도 예정되어 있습니다. Google DeepMind는 NVIDIA와 협력하여 NVFP4 커널을 포함한 하드웨어 최적화를 진행했으며, 이 모델은 Hugging Face, Gemini Enterprise Agent Platform, NVIDIA NIM에서 사용할 수 있습니다.
출처: Google DeepMind — 원문
관련 게시물 ↓
새로운 뉴스