ModelosCódigo Aberto 🇺🇸 27.07.2026 12:03

Google DeepMind apresenta Gemma 4 12B: modelo multimodal unificado sem codificadores

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
O Google DeepMind anunciou o Gemma 4 12B, um modelo multimodal compacto capaz de processar texto, imagens e áudio sem codificadores separados. O modelo roda em laptops padrão com 16 GB de RAM, supera muitas soluções em desempenho e está disponível sob a licença Apache 2.0.
Google DeepMind apresentou o Gemma 4 12B, um novo modelo de tamanho médio que combina capacidades de processamento de texto, imagens e áudio sem usar codificadores separados. Ao contrário dos modelos multimodais tradicionais, que dependem de codificadores separados para traduzir imagens e áudio, o Gemma 4 12B utiliza um módulo de incorporação leve para visão e projeta o sinal de áudio bruto diretamente no espaço de tokens de texto. O modelo alcança desempenho próximo ao do modelo maior Gemma 4 26B MoE, mas ocupa menos da metade da memória e pode ser executado localmente em notebooks de consumo com 16 GB de RAM. O Gemma 4 12B suporta previsão de tokens multithread (MTP) para reduzir latência e foi lançado sob a licença Apache 2.0. Os pesos do modelo estão disponíveis no Hugging Face e Kaggle, e os desenvolvedores podem usar ferramentas populares como Hugging Face Transformers, llama.cpp, MLX, SGLang e vLLM. Também foi lançado o conjunto oficial de habilidades Gemma Skills para suporte a agentes que trabalham com o modelo.
Fonte: Google DeepMind — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas