Google DeepMind представляет Gemma 4 12B: унифицированная мультимодальная модель без энкодеров
Google/DeepMind
Google DeepMind
Google DeepMind анонсировала Gemma 4 12B — компактную мультимодальную модель, способную обрабатывать текст, изображения и аудио без отдельных энкодеров. Модель работает на обычных ноутбуках с 16 ГБ ОЗУ, превосходит многие решения по производительности и доступна под лицензией Apache 2.0.
Google DeepMind представила Gemma 4 12B — новую модель среднего размера, которая объединяет возможности обработки текста, изображений и аудио без использования отдельных энкодеров. В отличие от традиционных мультимодальных моделей, которые полагаются на отдельные энкодеры для перевода изображений и аудио, Gemma 4 12B использует облегчённый модуль встраивания для зрения и проецирует сырой
Показать ещё ↓
- Сокращения
- MTP = Multi-Token Prediction — многопоточное предсказание токенов
- MoE = Mixture of Experts — смесь экспертов
Источник: Google DeepMind —
оригинал
