Matériel et InférenceRecherche 🇷🇺 05.08.2026 17:01

Les modèles d'IA peuvent fonctionner sur n'importe quoi : un passionné exécute un LLM sur un microcontrôleur à 10 dollars

Microsoft ResearchMicrosoft Research
Un passionné connu sous le nom de SlvDev a réussi à exécuter un grand modèle de langage localement sur un microcontrôleur ESP32-S3 qui coûte seulement 10 dollars, atteignant environ 10 jetons par seconde. Le projet a impliqué la quantification et l'utilisation de l'incorporation par couche pour adapter le modèle à la mémoire limitée de l'appareil.
En 2026, les grands modèles de langage peuvent être exécutés localement sur des ordinateurs portables et même des smartphones, mais un passionné sous le pseudonyme SlvDev est allé plus loin en exécutant un petit modèle de langage sur un microcontrôleur ESP32-S3 coûtant 10 $, atteignant une vitesse de traitement de près de 10 tokens par seconde. L'ESP32-S3 dispose de 520 Ko de SRAM et de 8 Mo de pseudo-SRAM (PSRAM), et est conçu pour contrôler des capteurs distants, des appareils IoT et d'autres équipements, mais exécuter quelque chose comme DeepSeek V4 Flash est hors de question. Au lieu de cela, SlvDev a choisi TinyStories, un modèle développé par Microsoft Research avec 28,9 millions de paramètres, soit environ 10 000 fois plus compact. Même ce modèle nécessitait initialement environ 60 Mo d'espace en précision 16 bits, ce qui était trop grand pour l'ESP32-S3. L'auteur a donc quantifié le modèle, compressant ses poids de 16 à 8 bits, puis à 4 bits, réduisant la taille du modèle à 14,9 Mo, ce qui nécessitait une version du microcontrôleur avec 16 Mo de mémoire flash. De plus, le passionné a implémenté un mécanisme d'incorporation par couche (PLE) utilisé dans l'architecture des modèles ouverts Gemma de Google, permettant de déplacer 25 millions de paramètres (12 Mo) vers la mémoire flash, qui est accédée relativement rarement, tandis que seulement 2 Mo de données ont été placés dans la RAM du contrôleur. En conséquence, les en-têtes d'entrée et le cache clé-valeur (KV) ont été placés dans la PSRAM, et 520 Ko de SRAM ont suffi pour l'activation. Ces mesures ont permis d'atteindre une génération à 9,88 tokens par seconde, plus rapide que ce qu'une personne moyenne peut lire. TinyStories est une excellente démonstration de concept mais ne génère que des histoires courtes, insuffisantes même pour un chatbot. Le modèle Barista, de taille similaire, peut répondre à des questions, génère des tokens deux fois plus vite, mais uniquement sur des sujets liés à l'espresso. Les deux modèles sont trop petits pour d'autres tâches, mais le fait qu'ils fonctionnent sur un ESP32 est impressionnant.
Source: 3DNews — original
Nos articles précédents sur ce sujet ↓
Infos fraîches