Laitteisto ja päättelyMediatuotanto 🇺🇸 27.07.2026 05:04

Hugging Face ja Cerebras yhdistävät voimansa reaaliaikaisen puhe-AI:n kanssa Gemma 4:n pohjalta

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
Hugging Face ja Cerebras ovat esitelleet avoimen lähdekoodin reaaliaikaisen puhesynteesiputken, joka hyödyntää Google DeepMindin Gemma 4 -mallia. Järjestelmä yhdistää Nvidian puheentunnistuksen, Cerebrasin päättelyn ja Alibaban puhesynteesin, varmistaen minimaalisen viiveen luonnollista dialogia varten. Kehittäjät voivat muokata ja laajentaa jokaista komponenttia täysin.
Hugging Face on yhdessä Cerebrasin kanssa luonut avoimen lähdekoodin reaaliaikaisen puhesynteesiputken, joka tekee äänipohjaisesta vuorovaikutuksesta tekoälyn kanssa mahdollisimman luonnollista. Järjestelmä toimii periaatteella "puhesyöte -> puheentunnistus Nvidia Parakeetilla -> tulos monimodaalisesta kielimallista Gemma 4 (Google DeepMindin kehittämä) Cerebras-kiihdyttimillä -> puhesynteesi Alibaban Qwen3TTS:llä -> puhetuloste". Jokainen osa on avoin, modulaarinen ja korvattavissa, minkä ansiosta kehittäjät voivat mukauttaa teknologiapinon omiin avustajiinsa, robotteihinsa tai tutkimusprojekteihinsa. Erityistä huomiota kiinnitetään viiveen vakauteen: vaikka monet järjestelmät osoittavat hyväksyttävän mediaaniviiveen, P95-tasolla (hitaimmat 5 % pyynnöistä) esiintyy edelleen useiden sekuntien taukoja. Cerebras ratkaisee tämän ongelman varmistamalla kielimallin nopean ja ennustettavan päättelyn. Samaa putkea käytetään jo Reachy Mini -roboteissa, joita on olemassa yli 10 000 kappaletta. Kehittäjiä kannustetaan kokeilemaan demoa Hugging Face Spacessa ja kokeilemaan koodia huggingface/speech-to-speech-repositoriosta.
Lähde: Hugging Face blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset