Google DeepMind presenta Gemma 4 12B: un modelo multimodal unificado sin codificadores
Google/DeepMind
Google DeepMind
Google DeepMind ha presentado Gemma 4 12B, un modelo de inteligencia artificial multimodal de tamaño mediano que procesa visión y audio directamente sin codificadores separados. Diseñado para ejecutarse en portátiles con 16 GB de RAM, ofrece capacidades avanzadas de razonamiento y agencia. El modelo se publica bajo licencia Apache 2.0 y es compatible con herramientas para desarrolladores como Hugging Face, Ollama y Google Cloud.
Google DeepMind anunció Gemma 4 12B, un modelo multimodal unificado sin codificadores dedicados para entradas de visión y audio, lo que permite el procesamiento directo por parte del tronco del LLM. Está diseñado para ejecutarse localmente en portátiles de consumo con 16 GB de VRAM o memoria unificada, ofreciendo un rendimiento cercano al del modelo MoE más grande de 26B, pero con una huella de memoria más reducida. Entre las características clave se incluyen entradas de audio nativas, borradores de predicción de múltiples tokens para una latencia reducida y una licencia Apache 2.0. El modelo está disponible para descargar en Hugging Face y Kaggle, y admite integración con herramientas como LM Studio, Ollama y Google Cloud. Los modelos Gemma 4 han superado los 150 millones de descargas.
Fuente: Google DeepMind —
original
