MallitAvoin lähdekoodi 🇺🇸 27.07.2026 12:03

Google DeepMind esittelee Gemma 4 12B:n: Yhtenäinen multimodaalimalli ilman erillisiä koodekkeja

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind on julkistanut Gemma 4 12B:n, kompaktin multimodaalimallin, joka pystyy käsittelemään tekstiä, kuvia ja ääntä ilman erillisiä koodekkeja. Malli toimii tavallisilla kannettavilla tietokoneilla, joissa on 16 Gt keskusmuistia, ylittää monien ratkaisujen suorituskyvyn ja on saatavilla Apache 2.0 -lisenssillä.
Google DeepMind on julkistanut Gemma 4 12B:n, uuden keskikokoisen mallin, joka yhdistää tekstin, kuvien ja äänen käsittelyn ilman erillisiä koodekkeja. Toisin kuin perinteiset multimodaaliset mallit, jotka käyttävät erillisiä koodekkeja kuvien ja äänen kääntämiseen, Gemma 4 12B hyödyntää kevyttä näön upotusmoduulia ja projisoi raa'an audiosignaalin suoraan tekstin token-avaruuteen. Malli saavuttaa lähes suuremman Gemma 4 26B MoE -mallin suorituskyvyn, mutta käyttää alle puolet muistista ja toimii paikallisesti kuluttajakannettavissa, joissa on 16 Gt RAM-muistia. Gemma 4 12B tukee multitoken-ennustusta (MTP) viiveen vähentämiseksi ja on julkaistu Apache 2.0 -lisenssillä. Mallin painot ovat saatavilla Hugging Facessa ja Kagglessa, ja kehittäjät voivat käyttää suosittuja työkaluja, kuten Hugging Face Transformers, llama.cpp, MLX, SGLang ja vLLM. Lisäksi on julkaistu virallinen Gemma Skills -taitosarja tukemaan mallin kanssa toimivia agentteja.
Lähde: Google DeepMind — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset