ModèlesOpen Source 🇺🇸 27.07.2026 12:03

Google DeepMind dévoile Gemma 4 12B : un modèle multimodal unifié sans codeurs

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind a annoncé Gemma 4 12B, un modèle multimodal compact capable de traiter du texte, des images et de l'audio sans codeurs séparés. Le modèle fonctionne sur des ordinateurs portables standard avec 16 Go de RAM, surpasse de nombreuses solutions en termes de performances et est disponible sous licence Apache 2.0.
Google DeepMind a dévoilé Gemma 4 12B, un nouveau modèle de taille moyenne qui combine les capacités de traitement du texte, des images et de l'audio sans utiliser de codeurs séparés. Contrairement aux modèles multimodaux traditionnels qui s'appuient sur des codeurs distincts pour traduire les images et l'audio, Gemma 4 12B utilise un module d'intégration léger pour la vision et projette le signal audio brut directement dans l'espace des jetons textuels. Le modèle atteint des performances proches de celles du modèle plus grand Gemma 4 26B MoE, tout en occupant moins de la moitié de la mémoire et en pouvant fonctionner localement sur des ordinateurs portables grand public dotés de 16 Go de RAM. Gemma 4 12B prend en charge la prédiction multi-token (MTP, pour "multi-token prediction") afin de réduire la latence et est publié sous licence Apache 2.0. Les poids du modèle sont disponibles sur Hugging Face et Kaggle, et les développeurs peuvent utiliser des outils populaires tels que Hugging Face Transformers, llama.cpp, MLX, SGLang et vLLM. Une suite officielle de compétences Gemma Skills a également été publiée pour prendre en charge les agents exploitant le modèle.
Source: Google DeepMind — original
Nos articles précédents sur ce sujet ↓
Infos fraîches