аудиосигнал напрямую в пространство текстовых токенов. Модель достигает производительности, близкой к более крупной модели Gemma 4 26B MoE, но при этом занимает менее половины объёма памяти и может работать локально на потребительских ноутбуках с 16 ГБ ОЗУ. Gemma 4 12B поддерживает многопоточное предсказание токенов (MTP) для снижения задержки и выпущена под лицензией Apache 2.0. Веса модели доступны на Hugging Face и Kaggle, а разработчики могут использовать популярные инструменты, такие как Hugging Face Transformers, llama.cpp, MLX, SGLang и vLLM. Также выпущен официальный набор навыков Gemma Skills для поддержки агентов, работающих с моделью.