Google DeepMind Memperkenalkan Gemma 4 12B: Model Multimodal Terpadu Tanpa Encoder
Google/DeepMind
Google DeepMind
Google DeepMind telah meluncurkan Gemma 4 12B, model AI multimodal berukuran menengah yang memproses penglihatan dan audio secara langsung tanpa encoder terpisah. Dirancang untuk berjalan di laptop dengan RAM 16GB, model ini menawarkan kemampuan penalaran dan agen yang canggih. Model ini dirilis di bawah lisensi Apache 2.0 dan mendukung alat pengembang seperti Hugging Face, Ollama, dan Google Cloud.
Google DeepMind mengumumkan Gemma 4 12B, model multimodal terpadu tanpa encoder khusus untuk input visual dan audio, yang memungkinkan pemrosesan langsung oleh backbone LLM (Large Language Model). Model ini dirancang untuk dijalankan secara lokal pada laptop konsumen dengan VRAM atau memori terpadu sebesar 16GB, memberikan performa yang mendekati model MoE (Mixture of Experts) 26B yang lebih besar namun dengan jejak memori yang lebih kecil. Fitur utamanya meliputi input audio asli, drafter Multi-Token Prediction untuk mengurangi latensi, dan lisensi Apache 2.0. Model ini tersedia untuk diunduh di Hugging Face dan Kaggle, serta mendukung integrasi dengan alat seperti LM Studio, Ollama, dan Google Cloud. Model Gemma 4 telah melampaui 150 juta unduhan.
Sumber: Google DeepMind —
asli
