ModelSumber Terbuka 🇺🇸 27.07.2026 12:02

DiffusionGemma: Generasi Teks 4x Lebih Cepat

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind telah memperkenalkan DiffusionGemma, sebuah model eksperimental terbuka 26B Mixture of Experts yang menggunakan difusi teks untuk menghasilkan teks hingga 4x lebih cepat daripada LLM autoregresif pada GPU. Model ini memproses blok 256 token secara simultan, menargetkan alur kerja lokal yang membutuhkan kecepatan tinggi seperti pengeditan sebaris, dan dirilis di bawah lisensi Apache 2.0 di Hugging Face.
Google DeepMind merilis DiffusionGemma, sebuah model Mixture of Experts (MoE) eksperimental dengan 26 miliar parameter di bawah lisensi Apache 2.0, yang mencapai pembuatan teks hingga 4 kali lebih cepat dengan menggunakan pendekatan berbasis difusi alih-alih prediksi token sekuensial. Model ini hanya mengaktifkan 3,8 miliar parameter per inferensi, muat dalam 18 GB VRAM saat dikuantisasi, dan mencapai lebih dari 1000 token per detik pada NVIDIA H100 serta 700+ pada GeForce RTX 5090. Model ini menggunakan perhatian dua arah (bi-directional attention) untuk menghasilkan 256 token secara paralel, memungkinkan tugas non-linear seperti penyisipan kode dan pemecahan Sudoku. DiffusionGemma dioptimalkan untuk inferensi lokal dengan konkurensi rendah, di mana pengkodean paralelnya memberikan manfaat maksimal, sementara model autoregresif tetap lebih baik untuk penyajian cloud dengan kueri per detik (QPS) tinggi. Model ini menyempurnakan keluarannya secara iteratif, dan dapat disempurnakan (fine-tuned) menggunakan alat seperti Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo, dengan dukungan llama.cpp yang akan datang. Google DeepMind berkolaborasi dengan NVIDIA untuk optimalisasi perangkat keras termasuk kernel NVFP4, dan model ini tersedia di Hugging Face, Gemini Enterprise Agent Platform, dan NVIDIA NIM.
Sumber: Google DeepMind — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru