ModellerAçık Kaynak 🇺🇸 27.07.2026 12:02

DiffusionGemma: 4 kat daha hızlı metin üretimi

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind, metin difüzyonu kullanan ve GPU'larda otoregresif büyük dil modellerine (LLM'ler) kıyasla 4 kata kadar daha hızlı üretim yapabilen deneysel bir açık 26 milyar parametreli Uzman Karışımı (Mixture of Experts) modeli olan DiffusionGemma'yı tanıttı. Model, 256 tokenlik blokları eşzamanlı işleyerek, hızın kritik olduğu satır içi düzenleme gibi yerel iş akışlarını hedefliyor ve Hugging Face'te Apache 2.0 lisansı altında yayınlandı.
Google DeepMind, Apache 2.0 lisansı altında deneysel bir model olan DiffusionGemma'yı yayınladı. Bu, 26 milyar parametreli bir Uzman Karışımı (MoE) modelidir ve sıralı token tahmini yerine difüzyon tabanlı bir yaklaşım kullanarak metin üretiminde 4 kata kadar hızlanma sağlar. Model, çıkarım başına yalnızca 3,8 milyar parametreyi etkinleştirir, kuantalandığında 18 GB VRAM'e sığar ve NVIDIA H100'de saniyede 1000'den fazla, GeForce RTX 5090'da ise 700'ün üzerinde token üretir. Çift yönlü dikkat mekanizması kullanarak 256 token'ı paralel olarak üretir ve kod tamamlama ile Sudoku çözme gibi doğrusal olmayan görevleri mümkün kılar. DiffusionGemma, düşük eşzamanlılığa sahip yerel çıkarım için optimize edilmiştir; paralel kod çözme burada maksimum fayda sağlarken, yüksek sorgu/saniye (QPS) bulut sunucuları için otoregresif modeller daha iyidir. Model, çıktısını yinelemeli olarak iyileştirir ve Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo gibi araçlarla ince ayar yapılabilir; llama.cpp desteği yakında gelecek. Google DeepMind, NVFP4 çekirdekleri dahil donanım optimizasyonları için NVIDIA ile işbirliği yaptı ve model Hugging Face, Gemini Enterprise Agent Platform ve NVIDIA NIM üzerinde kullanıma sunuldu.
Kaynak: Google DeepMind — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler