Laitteisto ja päättelyTutkimus 🇷🇺 05.08.2026 17:01

AI-mallit toimivat millä tahansa: harrastaja ajaa kielimallia 10 dollarin mikrokontrollerilla

Microsoft ResearchMicrosoft Research
Harrastaja, joka tunnetaan nimellä SlvDev, on onnistuneesti ajanut suurta kielimallia paikallisesti ESP32-S3-mikrokontrollerilla, joka maksaa vain 10 dollaria, saavuttaen noin 10 tokenia sekunnissa. Projektiin kuului mallin kvantisointi ja kerroskohtainen upotus, jotta malli mahtui laitteen rajalliseen muistiin.
Vuonna 2026 suuria kielimalleja voidaan ajaa paikallisesti kannettavissa tietokoneissa ja jopa älypuhelimissa, mutta harrastaja salanimellä SlvDev meni pidemmälle ajamalla pienen kielimallin ESP32-S3-mikrokontrollerilla, joka maksaa 10 dollaria, saavuttaen käsittelynopeuden lähes 10 tokenia sekunnissa. ESP32-S3:ssa on 520 kilotavua SRAM-muistia ja 8 megatavua pseudo-SRAM-muistia (PSRAM), ja se on suunniteltu ohjaamaan kauko-ohjattavia antureita, IoT-laitteita ja muuta laitteistoa, mutta sellaisen kuin DeepSeek V4 Flash -mallin ajaminen ei tule kysymykseen. Sen sijaan SlvDev valitsi TinyStories-mallin, jonka Microsoft Research on kehittänyt ja jossa on 28,9 miljoonaa parametria, mikä on noin 10 000 kertaa kompaktimpi. Jopa tämä malli vaati alun perin noin 60 megatavua tilaa 16-bittisellä tarkkuudella, mikä oli liikaa ESP32-S3:lle. Kirjoittaja kvantisoi siksi mallin, puristaen sen painot 16 bitistä 8 bittiin ja sitten 4 bittiin, mikä pienensi mallin koon 14,9 megatavuun, mikä vaati mikro-ohjaimen version, jossa on 16 megatavua flash-muistia. Lisäksi harrastaja toteutti kerroskohtaisen upotuksen (PLE) -mekanismin, jota käytetään Googlen Gemma-avointen mallien arkkitehtuurissa, mikä mahdollisti 25 miljoonan parametrin (12 megatavua) siirtämisen flash-muistiin, jota käytetään suhteellisen harvoin, kun taas vain 2 megatavua dataa sijoitettiin kontrollerin RAM-muistiin. Tämän seurauksena syöttöotsikot ja avain-arvo (KV) -välimuisti sijoitettiin PSRAM-muistiin, ja 520 kilotavua SRAM-muistia riitti aktivaatioon. Näillä toimenpiteillä saavutettiin sukupolven nopeus 9,88 tokenia sekunnissa, mikä on nopeampi kuin keskivertoihminen pystyy lukemaan. TinyStories on loistava konseptin esittely, mutta se tuottaa vain lyhyitä tarinoita, mikä ei riitä edes chatbotiksi. Samankokoinen Barista-malli pystyy vastaamaan kysymyksiin, tuottaa tokeneita kaksi kertaa nopeammin, mutta vain espressoon liittyvistä aiheista. Molemmat mallit ovat liian pieniä muihin tehtäviin, mutta se, että ne toimivat ESP32:ssa, on vaikuttavaa.
Lähde: 3DNews — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset