Hardware & InferentieOnderzoek 🇷🇺 05.08.2026 17:01

AI-modellen kunnen op alles draaien: liefhebber laat LLM draaien op een microcontroller van 10 dollar

Microsoft ResearchMicrosoft Research
Een liefhebber die bekendstaat als SlvDev heeft met succes een groot taalmodel lokaal laten draaien op een ESP32-S3-microcontroller die slechts 10 dollar kost, met een snelheid van ongeveer 10 tokens per seconde. Het project omvatte het kwantiseren en het gebruik van per-laag-embeddings om het model in het beperkte geheugen van het apparaat te laten passen.
In 2026 kunnen grote taalmodellen lokaal op laptops en zelfs smartphones draaien, maar een enthousiasteling onder het pseudoniem SlvDev ging verder door een klein taalmodel te draaien op een ESP32-S3-microcontroller van $10, met een verwerkingssnelheid van bijna 10 tokens per seconde. De ESP32-S3 heeft 520 KB SRAM en 8 MB pseudo-SRAM (PSRAM) en is ontworpen voor het aansturen van externe sensoren, IoT-apparaten en andere apparatuur, maar het draaien van zoiets als DeepSeek V4 Flash is uitgesloten. In plaats daarvan koos SlvDev voor TinyStories, een model ontwikkeld door Microsoft Research met 28,9 miljoen parameters, ongeveer 10.000 keer compacter. Zelfs dit model had aanvankelijk ongeveer 60 MB nodig bij 16-bit precisie, wat te groot was voor de ESP32-S3. De auteur kwantiseerde daarom het model, waarbij de gewichten werden gecomprimeerd van 16 naar 8 bits en vervolgens naar 4 bits, waardoor de modelgrootte teruggebracht werd tot 14,9 MB, wat een versie van de microcontroller met 16 MB flashgeheugen vereiste. Verder implementeerde de enthousiasteling een per-layer embedding (PLE)-mechanisme dat in de architectuur van Google Gemma open modellen wordt gebruikt, waardoor 25 miljoen parameters (12 MB) naar flashgeheugen konden worden verplaatst, dat relatief zelden wordt benaderd, terwijl slechts 2 MB aan gegevens in het RAM van de controller werd geplaatst. Als gevolg hiervan werden invoerheaders en key-value (KV)-cache in PSRAM geplaatst, en was 520 KB SRAM voldoende voor activering. Deze maatregelen leverden generatie op met 9,88 tokens per seconde, sneller dan een gemiddeld persoon kan lezen. TinyStories is een geweldige conceptdemonstratie, maar genereert alleen korte verhalen, onvoldoende zelfs voor een chatbot. Het qua grootte vergelijkbare Barista-model kan vragen beantwoorden, genereert tokens twee keer zo snel, maar alleen over onderwerpen die met espresso te maken hebben. Beide modellen zijn te klein voor andere taken, maar het feit dat ze op een ESP32 draaien is indrukwekkend.
Bron: 3DNews — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws