ModellerAraştırma 🇩🇪 09.08.2026 13:01

Google DiffusionGemma: Teknik rapor, hızlı metin difüzyon modelini açıklıyor

Google/DeepMindGoogle/DeepMind NVIDIANVIDIA
Google DeepMind, DiffusionGemma hakkında bir teknik rapor yayınladı. Bu metin difüzyon modeli, 256 token'ı paralel olarak üretiyor ve bir Nvidia H100 üzerinde saniyede yaklaşık 1.500 token'a ulaşıyor. Model, mevcut Gemma 4 modelinin bir difüzyon modeline dönüştürülmesiyle, orijinal eğitim token bütçesinin %10'undan daha azı kullanılarak oluşturuldu. Raporda, modelin kendi kendini düzeltme gibi güçlü yönleri ve akıl yürütme ile çok kullanıcılı verimlilikteki sınırlamaları vurgulanıyor.
Google DeepMind, DiffusionGemma için bir teknik rapor yayınladı. Haziran ortasında piyasaya sürülen bu model, 256 tokenlik blokları paralel olarak iyileştirerek metin üretiyor; bu, gürültüden görüntü üretimine benzer. Nvidia'nın H100 hızlandırıcısında saniyede yaklaşık 1.500 token elde ediyor. Sıfırdan eğitmek yerine, mevcut Gemma-4-26B-A4B modeli, orijinal eğitim token bütçesinin %10'undan daha azı kullanılarak bir difüzyon modeline dönüştürüldü. Eğitim iki aşamadan oluşuyordu: ilk olarak gürültülü metin bloklarını yeniden yapılandırmayı öğrenme, ardından Google'ın SD·RL olarak adlandırdığı pekiştirmeli öğrenme ve örnekleyici damıtmanın birleşik aşaması. Rapora göre bu, akıl yürütme kıyaslamalarını ortalama on puan iyileştirirken, adım başına token miktarını neredeyse dört katına çıkarıyor ve yanıtlar yaklaşık %50 daha kısa. DiffusionGemma'nın çift yönlü işlemesi, çıktıdan önce kendi kendini düzeltmeye olanak tanıyor; bu sayede ince ayar sonrasında Sudoku bulmacalarını %85 doğrulukla çözebiliyor, oysa temel model bunu başaramıyor. Ayrıca kelime kelime üretim yeteneğini koruyarak kullanıcıların modlar arasında geçiş yapmasına olanak tanıyor. Ancak, sonradan dönüştürme ve hıza odaklı kısa eğitim süresi gibi faktörler nedeniyle mutlak performans otoregresif modelin altında kalıyor. Model bazen tekrarlama döngülerine giriyor ve akıl yürütme bölümlerini kapatamayabiliyor, bu da kıyaslama puanlarını düşürüyor. Hız avantajı temel olarak tek kullanıcılı senaryolarda geçerli; 32 eşzamanlı isteğin üzerinde otoregresif modeller verimlilikte arayı kapatıyor. Google, DiffusionGemma'yı deneysel olarak konumlandırıyor; amacı araştırmayı hızlandırmak ve özelleştirilmiş uyarlamalar için bir temel sağlamak. Model halihazırda girişim Interfaze tarafından çok dilli konuşma tanıma ve etkileşimli radyoloji raporları projesinde kullanılıyor. Model, Apache 2.0 lisansıyla Hugging Face'te mevcut ve öncüsü Gemini Diffusion, Mayıs 2025'te tanıtıldı.
Kaynak: The Decoder (DE) — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler