KI-Modelle laufen auf allem: Enthusiast betreibt LLM auf einem 10-Dollar-Mikrocontroller
Microsoft Research
Ein Enthusiast namens SlvDev hat erfolgreich ein großes Sprachmodell lokal auf einem ESP32-S3-Mikrocontroller betrieben, der nur 10 Dollar kostet, und erreicht damit etwa 10 Tokens pro Sekunde. Das Projekt umfasste die Quantisierung und die Verwendung von Schicht-für-Schicht-Einbettungen, um das Modell in den begrenzten Speicher des Geräts zu integrieren.
Im Jahr 2026 können große Sprachmodelle lokal auf Laptops und sogar Smartphones ausgeführt werden, aber ein Enthusiast unter dem Pseudonym SlvDev ging noch einen Schritt weiter, indem er ein kleines Sprachmodell auf einem ESP32-S3-Mikrocontroller für 10 US-Dollar zum Laufen brachte und dabei eine Verarbeitungsgeschwindigkeit von fast 10 Token pro Sekunde erzielte. Der ESP32-S3 verfügt über 520 KB SRAM und 8 MB Pseudo-SRAM (PSRAM) und ist für die Steuerung von Fernsensoren, IoT-Geräten und anderen Geräten konzipiert, aber etwas wie DeepSeek V4 Flash auszuführen kommt nicht in Frage. Stattdessen wählte SlvDev TinyStories, ein von Microsoft Research entwickeltes Modell mit 28,9 Millionen Parametern, das etwa 10.000-mal kompakter ist. Selbst dieses Modell benötigte anfangs etwa 60 MB Speicherplatz bei 16-Bit-Präzision, was für den ESP32-S3 zu groß war. Der Autor quantisierte das Modell daher und komprimierte seine Gewichte von 16 auf 8 Bit und dann auf 4 Bit, wodurch sich die Modellgröße auf 14,9 MB reduzierte, was eine Version des Mikrocontrollers mit 16 MB Flash-Speicher erforderte. Darüber hinaus implementierte der Enthusiast einen Per-Layer-Embedding-Mechanismus (PLE), der in der Architektur der offenen Modelle von Google Gemma verwendet wird, wodurch 25 Millionen Parameter (12 MB) in den Flash-Speicher verschoben werden konnten, auf den relativ selten zugegriffen wird, während nur 2 MB Daten im RAM des Controllers platziert wurden. Dadurch wurden Eingabe-Header und Key-Value-Cache (KV-Cache) in PSRAM platziert, und 520 KB SRAM reichten für die Aktivierung aus. Diese Maßnahmen erreichten eine Generierung von 9,88 Token pro Sekunde, schneller als ein durchschnittlicher Mensch lesen kann. TinyStories ist eine großartige Konzeptdemonstration, erzeugt aber nur kurze Geschichten, die nicht einmal für einen Chatbot ausreichen. Das ähnlich große Barista-Modell kann Fragen beantworten, erzeugt Token doppelt so schnell, aber nur zu Themen rund um Espresso. Beide Modelle sind für andere Aufgaben zu klein, aber die Tatsache, dass sie auf einem ESP32 laufen, ist beeindruckend.
Quelle: 3DNews —
Original
