Google DeepMind onthult Gemma 4 12B: een uniform multimodaal model zonder encoders
Google/DeepMind
Google DeepMind
Google DeepMind heeft Gemma 4 12B aangekondigd, een compact multimodaal model dat tekst, afbeeldingen en audio kan verwerken zonder aparte encoders. Het model draait op standaard laptops met 16 GB RAM, presteert beter dan veel oplossingen en is beschikbaar onder de Apache 2.0-licentie.
Google DeepMind heeft Gemma 4 12B gepresenteerd, een nieuw model van gemiddelde grootte dat tekst-, beeld- en audioverwerking combineert zonder aparte encoders te gebruiken. In tegenstelling tot traditionele multimodale modellen, die afhankelijk zijn van afzonderlijke encoders voor het vertalen van afbeeldingen en audio, maakt Gemma 4 12B gebruik van een lichtgewicht inbeddingsmodule voor visie en projecteert het ruwe audiosignaal direct in de ruimte van teksttokens. Het model presteert bijna net zo goed als het grotere model Gemma 4 26B MoE, maar neemt minder dan de helft van het geheugen in beslag en kan lokaal draaien op consumentenlaptops met 16 GB RAM. Gemma 4 12B ondersteunt meettokenvoorspelling (multi-token prediction, MTP) om de latentie te verminderen en is uitgebracht onder de Apache 2.0-licentie. De gewichten van het model zijn beschikbaar op Hugging Face en Kaggle, en ontwikkelaars kunnen populaire tools gebruiken zoals Hugging Face Transformers, llama.cpp, MLX, SGLang en vLLM. Ook is er een officiële set vaardigheden genaamd Gemma Skills uitgebracht om agents te ondersteunen die met het model werken.
Bron: Google DeepMind —
origineel
