ModelosCódigo Abierto 🇺🇸 27.07.2026 12:03

Google DeepMind presenta Gemma 4 12B: un modelo multimodal unificado sin codificadores

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind ha anunciado Gemma 4 12B, un modelo multimodal compacto capaz de procesar texto, imágenes y audio sin codificadores separados. El modelo funciona en ordenadores portátiles estándar con 16 GB de RAM, supera a muchas soluciones en rendimiento y está disponible bajo la licencia Apache 2.0.
Google DeepMind ha presentado Gemma 4 12B, un nuevo modelo de tamaño mediano que combina capacidades de procesamiento de texto, imágenes y audio sin utilizar codificadores separados. A diferencia de los modelos multimodales tradicionales, que dependen de codificadores individuales para traducir imágenes y audio, Gemma 4 12B emplea un módulo de incrustación ligero para la visión y proyecta la señal de audio cruda directamente en el espacio de los tokens de texto. El modelo alcanza un rendimiento cercano al del modelo más grande Gemma 4 26B MoE, pero ocupa menos de la mitad de memoria y puede ejecutarse localmente en ordenadores portátiles de consumo con 16 GB de RAM. Gemma 4 12B admite la predicción multitoken (MTP, por sus siglas en inglés) para reducir la latencia y se publica bajo la licencia Apache 2.0. Los pesos del modelo están disponibles en Hugging Face y Kaggle, y los desarrolladores pueden utilizar herramientas populares como Hugging Face Transformers, llama.cpp, MLX, SGLang y vLLM. También se ha lanzado un conjunto oficial de habilidades Gemma Skills para soportar agentes que trabajen con el modelo.
Fuente: Google DeepMind — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas