Modelos de IA Podem Rodar em Qualquer Coisa: Entusiasta Executa LLM em um Microcontrolador de US$ 10
Microsoft Research
Um entusiasta conhecido como SlvDev conseguiu executar um modelo de linguagem de grande porte localmente em um microcontrolador ESP32-S3 que custa apenas US$ 10, alcançando cerca de 10 tokens por segundo. O projeto envolveu quantização e uso de embeddings por camada para caber o modelo na memória limitada do dispositivo.
Em 2026, grandes modelos de linguagem podem ser executados localmente em laptops e até mesmo em smartphones, mas um entusiasta sob o pseudônimo SlvDev foi além ao rodar um pequeno modelo de linguagem em um microcontrolador ESP32-S3 que custa US$ 10, alcançando uma velocidade de processamento de quase 10 tokens por segundo. O ESP32-S3 possui 520 KB de SRAM e 8 MB de pseudo-SRAM (PSRAM), e é projetado para controlar sensores remotos, dispositivos IoT e outros equipamentos, mas rodar algo como DeepSeek V4 Flash está fora de questão. Em vez disso, SlvDev escolheu TinyStories, um modelo desenvolvido pela Microsoft Research com 28,9 milhões de parâmetros, que é cerca de 10.000 vezes mais compacto. Mesmo esse modelo inicialmente exigia cerca de 60 MB de espaço na precisão de 16 bits, o que era grande demais para o ESP32-S3. O autor, portanto, quantizou o modelo, comprimindo seus pesos de 16 para 8 bits, e depois para 4 bits, reduzindo o tamanho do modelo para 14,9 MB, o que exigiu uma versão do microcontrolador com 16 MB de memória flash. Além disso, o entusiasta implementou um mecanismo de incorporação por camada (PLE) utilizado na arquitetura dos modelos abertos Gemma do Google, permitindo que 25 milhões de parâmetros (12 MB) fossem movidos para a memória flash, que é acessada com relativa pouca frequência, enquanto apenas 2 MB de dados foram colocados na RAM do controlador. Como resultado, cabeçalhos de entrada e cache de chave-valor (KV) foram colocados na PSRAM, e 520 KB de SRAM foram suficientes para a ativação. Essas medidas alcançaram geração a 9,88 tokens por segundo, mais rápido do que uma pessoa média consegue ler. TinyStories é uma ótima demonstração de conceito, mas apenas gera histórias curtas, insuficientes até mesmo para um chatbot. O modelo Barista, de tamanho semelhante, pode responder perguntas, gera tokens duas vezes mais rápido, mas apenas sobre tópicos relacionados a expresso. Ambos os modelos são pequenos demais para outras tarefas, mas o fato de rodarem em um ESP32 é impressionante.
Fonte: 3DNews —
original
