ModèlesOpen Source 🇺🇸 27.07.2026 12:03

Google DeepMind présente Gemma 4 12B : un modèle multimodal unifié sans encodeurs

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind a dévoilé Gemma 4 12B, un modèle d'IA multimodal de taille moyenne qui traite directement la vision et l'audio sans encodeurs séparés. Conçu pour fonctionner sur des ordinateurs portables avec 16 Go de RAM, il offre des capacités de raisonnement avancées et agentiques. Le modèle est publié sous licence Apache 2.0 et prend en charge des outils de développement tels que Hugging Face, Ollama et Google Cloud.
Google DeepMind a annoncé Gemma 4 12B, un modèle multimodal unifié sans encodeurs dédiés pour les entrées visuelles et audio, permettant un traitement direct par le réseau principal du modèle de langage. Il est conçu pour une exécution locale sur des ordinateurs portables grand public disposant de 16 Go de mémoire vidéo ou de mémoire unifiée, offrant des performances proches du modèle MoE plus grand de 26B mais avec une empreinte mémoire réduite. Les fonctionnalités clés incluent des entrées audio natives, des rédacteurs de prédiction multi-tokens pour une latence réduite, et une licence Apache 2.0. Le modèle est disponible en téléchargement sur Hugging Face et Kaggle, et prend en charge l'intégration avec des outils comme LM Studio, Ollama et Google Cloud. Les modèles Gemma 4 ont dépassé les 150 millions de téléchargements.
Source: Google DeepMind — original
Nos articles précédents sur ce sujet ↓
Infos fraîches