AIモデルは何でも動く: 愛好家が10ドルのマイコンでLLMを実行
Microsoft Research
SlvDevとして知られる愛好家が、わずか10ドルのESP32-S3マイクロコントローラ上で大規模言語モデルをローカルで実行することに成功し、毎秒約10トークンを達成しました。このプロジェクトでは、モデルをデバイスの限られたメモリに収めるために、量子化と層ごとの埋め込みを使用しました。
2026年には、大規模言語モデルをノートパソコンやスマートフォン上でローカルに実行できるようになるが、SlvDevという偽名の愛好家はさらに踏み込み、10ドルのESP32-S3マイクロコントローラ上で小規模言語モデルを動かし、毎秒約10トークンの処理速度を達成した。ESP32-S3は520KBのSRAMと8MBの疑似SRAM(PSRAM)を搭載し、リモートセンサーやIoTデバイスなどの制御を目的としているが、DeepSeek V4 Flashのようなものを動かすことは到底できない。その代わりにSlvDevは、マイクロソフトリサーチが開発した2890万パラメータのモデルであるTinyStoriesを選んだ。これは約1万分の1の規模である。それでも、このモデルは当初16ビット精度で約60MBの容量を必要とし、ESP32-S3には大きすぎた。そこで著者はモデルを量子化し、重みを16ビットから8ビット、さらに4ビットに圧縮してモデルサイズを14.9MBに削減した。これには16MBのフラッシュメモリを搭載したマイクロコントローラのバージョンが必要だった。さらに、愛好家はGoogleのGemmaオープンモデルのアーキテクチャで使用されているレイヤーごとの埋め込み(PLE)メカニズムを実装し、2500万パラメータ(12MB)を比較的頻度の低いフラッシュメモリに移動させ、コントローラのRAMにはわずか2MBのデータのみを配置した。その結果、入力ヘッダーとキーバリュー(KV)キャッシュはPSRAMに配置され、520KBのSRAMでアクティベーションに十分だった。これらの対策により、1秒あたり9.88トークンの生成を達成し、これは平均的な人が読む速度よりも速い。TinyStoriesは素晴らしいコンセプトデモだが、短編小説しか生成できず、チャットボットには不十分である。同規模のBaristaモデルは質問に答えられ、トークン生成速度は2倍速いが、エスプレッソ関連のトピックに限られる。どちらのモデルも他のタスクには小さすぎるが、ESP32上で動作するという事実は印象的である。
出典: 3DNews —
原文
