Google DeepMind stellt Gemma 4 12B vor: ein einheitliches multimodales Modell ohne Encoder
Google/DeepMind
Google DeepMind
Google DeepMind hat Gemma 4 12B vorgestellt, ein mittelgroßes multimodales KI-Modell, das Bild und Audio direkt ohne separate Encoder verarbeitet. Entwickelt für den Betrieb auf Laptops mit 16 GB RAM, bietet es erweiterte Denk- und Agentenfähigkeiten. Das Modell wird unter der Apache-2.0-Lizenz veröffentlicht und unterstützt Entwicklerwerkzeuge wie Hugging Face, Ollama und Google Cloud.
Google DeepMind hat Gemma 4 12B angekündigt, ein einheitliches multimodales Modell ohne dedizierte Encoder für visuelle und Audio-Eingaben, die direkt vom LLM-Backbone verarbeitet werden. Es ist für die lokale Ausführung auf Consumer-Laptops mit 16 GB VRAM oder Unified Memory ausgelegt und liefert eine Leistung nahe dem größeren 26B MoE-Modell, jedoch mit einem geringeren Speicherbedarf. Zu den wichtigsten Funktionen gehören native Audio-Eingaben, Multi-Token Prediction Drafters zur Reduzierung der Latenz und eine Apache-2.0-Lizenz. Das Modell steht zum Download auf Hugging Face und Kaggle zur Verfügung und unterstützt die Integration mit Tools wie LM Studio, Ollama und Google Cloud. Gemma-4-Modelle haben die Marke von 150 Millionen Downloads überschritten.
Quelle: Google DeepMind —
Original
