ModelleOpen Source 🇺🇸 27.07.2026 12:03

Google DeepMind stellt Gemma 4 12B vor: Ein einheitliches multimodales Modell ohne Encoder

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind hat Gemma 4 12B angekündigt, ein kompaktes multimodales Modell, das Text, Bilder und Audio ohne separate Encoder verarbeiten kann. Das Modell läuft auf handelsüblichen Laptops mit 16 GB RAM, übertrifft viele Lösungen in der Leistung und ist unter der Apache-2.0-Lizenz verfügbar.
Google DeepMind hat Gemma 4 12B vorgestellt – ein neues mittelgroßes Modell, das die Verarbeitung von Text, Bildern und Audio ohne separate Encoder vereint. Im Gegensatz zu traditionellen multimodalen Modellen, die auf separate Encoder zur Übersetzung von Bildern und Audio angewiesen sind, verwendet Gemma 4 12B ein leichtes Einbettungsmodul für das Sehen und projiziert rohe Audiosignale direkt in den Raum der Text-Token. Das Modell erreicht eine Leistung, die nahe an der des größeren Modells Gemma 4 26B MoE liegt, benötigt aber weniger als die Hälfte des Speichers und kann lokal auf Consumer-Notebooks mit 16 Gigabyte RAM ausgeführt werden. Gemma 4 12B unterstützt Multi-Token Prediction (MTP) zur Reduzierung der Latenz und wird unter der Apache-2.0-Lizenz veröffentlicht. Die Modellgewichte sind auf Hugging Face und Kaggle verfügbar, und Entwickler können gängige Tools wie Hugging Face Transformers, llama.cpp, MLX, SGLang und vLLM nutzen. Zudem wurde ein offizielles Gemma Skills Toolkit für die Unterstützung von Agenten, die mit dem Modell arbeiten, veröffentlicht.
Quelle: Google DeepMind — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten