МоделиOpen Source 🇺🇸 27.07.2026 12:03

Google DeepMind представляет Gemma 4 12B: унифицированная мультимодальная модель без энкодеров

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind анонсировала Gemma 4 12B — компактную мультимодальную модель, способную обрабатывать текст, изображения и аудио без отдельных энкодеров. Модель работает на обычных ноутбуках с 16 ГБ ОЗУ, превосходит многие решения по производительности и доступна под лицензией Apache 2.0.
Google DeepMind представила Gemma 4 12B — новую модель среднего размера, которая объединяет возможности обработки текста, изображений и аудио без использования отдельных энкодеров. В отличие от традиционных мультимодальных моделей, которые полагаются на отдельные энкодеры для перевода изображений и аудио, Gemma 4 12B использует облегчённый модуль встраивания для зрения и проецирует сырой
Показать ещё ↓
Сокращения
MTP = Multi-Token Prediction — многопоточное предсказание токенов
MoE = Mixture of Experts — смесь экспертов
Источник: Google DeepMind — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости