Google DeepMind, Kodlayıcısız Birleşik Multimodal Model Gemma 4 12B'yi Tanıttı
Google/DeepMind
Google DeepMind
Google DeepMind, görsel ve sesi ayrı kodlayıcılar olmadan doğrudan işleyen orta ölçekli bir multimodal yapay zeka modeli olan Gemma 4 12B'yi duyurdu. 16GB RAM ile dizüstü bilgisayarlarda çalışacak şekilde tasarlanan model, gelişmiş akıl yürütme ve aracı yetenekleri sunuyor. Model, Apache 2.0 lisansı altında yayımlanıyor ve Hugging Face, Ollama ve Google Cloud gibi geliştirici araçlarını destekliyor.
Google DeepMind, Gemma 4 12B'yi duyurdu: görsel ve ses girdileri için özel kodlayıcılar olmadan, LLM omurgası tarafından doğrudan işlenebilen birleşik bir çok modlu model. 16GB VRAM veya birleşik belleğe sahip tüketici dizüstü bilgisayarlarında yerel olarak çalıştırılmak üzere tasarlanmış olup, daha büyük 26B MoE modeline yakın performans sunarken daha küçük bir bellek ayak izine sahiptir. Temel özellikler arasında yerel ses girdileri, gecikmeyi azaltmak için Çoklu Token Tahmin (Multi-Token Prediction) hazırlayıcıları ve Apache 2.0 lisansı yer alıyor. Model, Hugging Face ve Kaggle üzerinden indirilebilir ve LM Studio, Ollama ve Google Cloud gibi araçlarla entegrasyonu destekler. Gemma 4 modelleri 150 milyon indirmeyi aştı.
Kaynak: Google DeepMind —
orijinal
