Google DeepMind introduceert Gemma 4 12B: een verenigd multimodaal model zonder encoders
Google/DeepMind
Google DeepMind
Google DeepMind heeft Gemma 4 12B onthuld, een middelgroot multimodaal AI-model dat direct visuele en auditieve data verwerkt zonder aparte encoders. Het is ontworpen om te draaien op laptops met 16 GB RAM en biedt geavanceerde redeneer- en agentische mogelijkheden. Het model wordt uitgebracht onder de Apache 2.0-licentie en ondersteunt ontwikkeltools zoals Hugging Face, Ollama en Google Cloud.
Google DeepMind heeft Gemma 4 12B aangekondigd, een uniform multimodaal model zonder speciale encoders voor visuele- en audio-invoer, waardoor directe verwerking door de LLM-backbone mogelijk is. Het is ontworpen voor lokale uitvoering op consumentenlaptops met 16 GB VRAM of unified memory en levert prestaties die dicht bij het grotere 26B MoE-model liggen, maar met een kleinere geheugenvoetafdruk. Belangrijke kenmerken zijn native audio-invoer, Multi-Token Prediction drafters voor lagere latentie en een Apache 2.0-licentie. Het model is beschikbaar voor download op Hugging Face en Kaggle en ondersteunt integratie met tools zoals LM Studio, Ollama en Google Cloud. Gemma 4-modellen hebben inmiddels meer dan 150 miljoen downloads behaald.
Bron: Google DeepMind —
origineel
