Google DeepMind apresenta Gemma 4 12B: um modelo multimodal unificado sem codificadores
Google/DeepMind
Google DeepMind
A Google DeepMind lançou o Gemma 4 12B, um modelo de IA multimodal de tamanho médio que processa visão e áudio diretamente, sem codificadores separados. Projetado para rodar em laptops com 16 GB de RAM, oferece raciocínio avançado e capacidades de agente. O modelo é lançado sob licença Apache 2.0 e suporta ferramentas de desenvolvedor como Hugging Face, Ollama e Google Cloud.
O Google DeepMind anunciou o Gemma 4 12B, um modelo multimodal unificado sem codificadores dedicados para entradas visuais e de áudio, permitindo processamento direto pelo backbone do LLM. Ele foi projetado para execução local em laptops de consumo com 16 GB de VRAM ou memória unificada, entregando desempenho próximo ao do modelo MoE maior de 26B, mas com uma pegada de memória menor. Os principais recursos incluem entradas de áudio nativas, rascunhadores de Previsão de Múltiplos Tokens (Multi-Token Prediction) para redução de latência e uma licença Apache 2.0. O modelo está disponível para download no Hugging Face e no Kaggle, e suporta integração com ferramentas como LM Studio, Ollama e Google Cloud. Os modelos Gemma 4 ultrapassaram 150 milhões de downloads.
Fonte: Google DeepMind —
original
