Los Modelos de IA Pueden Ejecutarse en Cualquier Dispositivo: un Entusiasta Ejecuta un LLM en un Microcontrolador de 10 Dólares
Microsoft Research
Un entusiasta conocido como SlvDev ha logrado ejecutar un modelo de lenguaje grande de manera local en un microcontrolador ESP32-S3 que cuesta apenas 10 dólares, alcanzando unas 10 fichas por segundo. El proyecto implicó cuantizar y utilizar incrustaciones por capa para ajustar el modelo a la memoria limitada del dispositivo.
En 2026, los grandes modelos de lenguaje pueden ejecutarse localmente en portátiles e incluso en teléfonos inteligentes, pero un entusiasta bajo el seudónimo de SlvDev fue más allá al ejecutar un pequeño modelo de lenguaje en un microcontrolador ESP32-S3 que cuesta 10 dólares, logrando una velocidad de procesamiento de casi 10 tokens por segundo. El ESP32-S3 tiene 520 KB de SRAM y 8 MB de pseudo-SRAM (PSRAM), y está diseñado para controlar sensores remotos, dispositivos IoT y otros equipos, pero ejecutar algo como DeepSeek V4 Flash es impensable. En su lugar, SlvDev eligió TinyStories, un modelo desarrollado por Microsoft Research con 28,9 millones de parámetros, que es unas 10.000 veces más compacto. Incluso este modelo inicialmente requería unos 60 MB de espacio con precisión de 16 bits, lo que era demasiado grande para el ESP32-S3. Por lo tanto, el autor cuantizó el modelo, comprimiendo sus pesos de 16 a 8 bits, y luego a 4 bits, reduciendo el tamaño del modelo a 14,9 MB, lo que requirió una versión del microcontrolador con 16 MB de memoria flash. Además, el entusiasta implementó un mecanismo de incrustación por capas (PLE) utilizado en la arquitectura de los modelos abiertos Gemma de Google, lo que permitió mover 25 millones de parámetros (12 MB) a la memoria flash, a la que se accede con relativa poca frecuencia, mientras que solo se colocaron 2 MB de datos en la RAM del controlador. Como resultado, los encabezados de entrada y la caché de clave-valor (KV) se colocaron en la PSRAM, y 520 KB de SRAM fueron suficientes para la activación. Estas medidas lograron una generación de 9,88 tokens por segundo, más rápido de lo que una persona promedio puede leer. TinyStories es una gran demostración de concepto, pero solo genera historias cortas, insuficiente incluso para un chatbot. El modelo Barista de tamaño similar puede responder preguntas, genera tokens el doble de rápido, pero solo sobre temas relacionados con el espresso. Ambos modelos son demasiado pequeños para otras tareas, pero el hecho de que se ejecuten en un ESP32 es impresionante.
Fuente: 3DNews —
original
