硬件与推理研究 🇷🇺 05.08.2026 17:01

AI模型无所不能:爱好者用10美元微控制器运行大语言模型

Microsoft ResearchMicrosoft Research
一位名为SlvDev的爱好者成功在一块仅需10美元的ESP32-S3微控制器上本地运行了大语言模型,实现了大约每秒10个词元的速度。该项目通过量化及逐层嵌入技术,将模型适配到设备的有限内存中。
到2026年,大型语言模型已经可以在笔记本电脑甚至智能手机上本地运行,但一位化名为SlvDev的爱好者更进一步,在售价10美元的ESP32-S3微控制器上运行了一个小型语言模型,处理速度接近每秒10个词元。ESP32-S3拥有520 KB的SRAM和8 MB的伪静态随机存取存储器(PSRAM),专为控制远程传感器、物联网设备和其他设备而设计,但运行类似DeepSeek V4 Flash这样的模型是不可能的。相反,SlvDev选择了由微软研究院开发的拥有2890万参数的TinyStories模型,其规模大约紧凑了一万倍。即使如此,这个模型最初在16位精度下需要约60 MB的空间,对于ESP32-S3来说仍然太大。因此,作者对模型进行了量化,将权重从16位压缩到8位,再压缩到4位,将模型大小缩减至14.9 MB,这需要具有16 MB闪存的微控制器版本。此外,这位爱好者还实现了谷歌Gemma开放模型架构中使用的逐层嵌入(PLE)机制,使得2500万参数(12 MB)可以移至闪存中,这些参数访问频率相对较低,而只有2 MB的数据放在控制器的RAM中。结果,输入头部和键值(KV)缓存被置于PSRAM中,而520 KB的SRAM足以用于激活。这些措施实现了每秒9.88个词元的生成速度,比普通人阅读速度还快。TinyStories是一个很好的概念演示,但只能生成短篇故事,甚至不足以用于聊天机器人。类似规模的Barista模型可以回答问题,生成词元的速度是其两倍,但仅限于浓缩咖啡相关话题。这两个模型都因规模太小而无法执行其他任务,但它们在ESP32上运行的事实令人印象深刻。
来源: 3DNews — 原文
我们之前关于此话题的帖子 ↓
最新新闻