Google DeepMind esittelee Gemma 4 12B:n: yhtenäinen multimodaalinen malli ilman erillisiä koodereita
Google/DeepMind
Google DeepMind
Google DeepMind on julkaissut Gemma 4 12B -mallin, keskitason multimodaalisen tekoälymallin, joka käsittelee näkö- ja äänidataa suoraan ilman erillisiä koodereita. Se on suunniteltu toimimaan kannettavissa tietokoneissa, joissa on 16 Gt RAM-muistia, ja tarjoaa edistyneitä päättely- ja agenttiominaisuuksia. Malli on julkaistu Apache 2.0 -lisenssillä ja tukee kehittäjätyökaluja, kuten Hugging Face, Ollama ja Google Cloud.
Google DeepMind julkisti Gemma 4 12B:n, yhtenäisen multimodaalisen mallin ilman erillisiä enkoodereita näkö- ja äänisyötteille, mikä mahdollistaa suoran käsittelyn kielimallin runkoyksiköllä. Se on suunniteltu paikalliseen suoritukseen kuluttajatietokoneissa, joissa on 16 gigatavua VRAM-muistia tai yhtenäismuistia, ja se tarjoaa suorituskykyä lähellä suurempaa 26 miljardin parametrin MoE-mallia, mutta pienemmällä muistijäljellä. Keskeisiä ominaisuuksia ovat alkuperäiset äänisyötteet, Multi-Token Prediction -luonnospalikat (drafters) viiveen vähentämiseksi sekä Apache 2.0 -lisenssi. Malli on ladattavissa Hugging Facesta ja Kagglesta, ja se tukee integraatiota työkaluihin, kuten LM Studio, Ollama ja Google Cloud. Gemma 4 -mallit ovat ylittäneet 150 miljoonaa latausta.
Lähde: Google DeepMind —
Alkuperäinen
