谷歌 DeepMind 发布 Gemma 4 12B:无需编码器的统一多模态模型
Google/DeepMind
Google DeepMind
谷歌 DeepMind 推出了 Gemma 4 12B,这是一款中型多模态 AI 模型,无需单独编码器即可直接处理视觉和音频。该模型设计可在配备 16GB 内存的笔记本电脑上运行,具备高级推理和自主代理能力。根据 Apache 2.0 许可证发布,并支持 Hugging Face、Ollama 和 Google Cloud 等开发者工具。
谷歌DeepMind宣布推出Gemma 4 12B,这是一款统一多模态模型,无需专用编码器处理视觉和音频输入,而是由LLM骨干直接处理。该模型专为在配备16GB显存或统一内存的消费级笔记本电脑上本地运行而设计,在显著降低内存占用的同时,性能接近更大的26B MoE模型。其核心特性包括原生音频输入、用于降低延迟的多令牌预测起草器,以及采用Apache 2.0许可证。该模型已在Hugging Face和Kaggle平台开放下载,并支持与LM Studio、Ollama及谷歌云(Google Cloud)等工具集成。截至目前,Gemma 4系列模型的下载量已突破1.5亿次。
来源: Google DeepMind —
原文
