模型开源 🇺🇸 27.07.2026 12:03

谷歌 DeepMind 发布 Gemma 4 12B:无编码器的统一多模态模型

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
谷歌 DeepMind 宣布推出 Gemma 4 12B,这是一款紧凑型多模态模型,无需独立编码器即可处理文本、图像和音频。该模型可在配备 16 GB 内存的标准笔记本上运行,性能超越众多解决方案,并采用 Apache 2.0 许可证发布。
Google DeepMind 发布了 Gemma 4 12B——一款新型中等规模模型,它无需使用独立的编码器即可同时处理文本、图像和音频。与依赖独立编码器来转换图像和音频的传统多模态模型不同,Gemma 4 12B 使用了一个轻量级的视觉嵌入模块,并将原始音频信号直接投影到文本令牌空间中。该模型的性能接近更大的 Gemma 4 26B MoE 模型,但占用的内存不到后者的一半,并且可以在配备 16GB RAM 的消费级笔记本电脑上本地运行。Gemma 4 12B 支持多令牌预测(MTP)以降低延迟,并已根据 Apache 2.0 许可证发布。模型权重可在 Hugging Face 和 Kaggle 上获取,开发者可以使用 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 等流行工具。此外,还发布了官方的 Gemma Skills 工具包,以支持使用该模型的智能体。
来源: Google DeepMind — 原文
我们之前关于此话题的帖子 ↓
最新新闻