Donanım ve ÇıkarımAraştırma 🇷🇺 05.08.2026 17:01

Yapay Zeka Modelleri Her Şeyde Çalışabilir: Meraklı, 10 Dolarlık Mikrodenetleyicide LLM Çalıştırdı

Microsoft ResearchMicrosoft Research
SlvDev olarak bilinen bir meraklı, yalnızca 10 dolara mal olan bir ESP32-S3 mikrodenetleyicisinde büyük bir dil modelini yerel olarak çalıştırmayı başardı ve saniyede yaklaşık 10 token elde etti. Proje, modeli cihazın sınırlı belleğine sığdırmak için niceleme ve katman başına gömme kullanmayı içeriyordu.
2026 yılında büyük dil modelleri dizüstü bilgisayarlarda ve hatta akıllı telefonlarda yerel olarak çalıştırılabiliyor, ancak SlvDev takma adlı bir meraklı, 10 dolarlık bir ESP32-S3 mikrodenetleyicisinde küçük bir dil modeli çalıştırarak daha da ileri gitti ve saniyede yaklaşık 10 token işleme hızına ulaştı. ESP32-S3'te 520 KB SRAM ve 8 MB sahte SRAM (PSRAM) bulunuyor ve uzak sensörleri, nesnelerin interneti cihazlarını ve diğer ekipmanları kontrol etmek için tasarlanmış durumda, ancak DeepSeek V4 Flash gibi bir şey çalıştırmak söz konusu değil. Bunun yerine SlvDev, Microsoft Research tarafından geliştirilen ve yaklaşık 10.000 kat daha kompakt olan 28.9 milyon parametreli TinyStories modelini seçti. Bu model bile başlangıçta 16 bit hassasiyetinde yaklaşık 60 MB alan gerektiriyordu ve bu da ESP32-S3 için çok büyüktü. Bu nedenle yazar modeli niceleyerek ağırlıklarını 16 bitten 8 bit'e ve ardından 4 bit'e sıkıştırdı ve model boyutunu 14.9 MB'a düşürdü; bu, 16 MB flash belleğe sahip mikrodenetleyici sürümünü gerektirdi. Ayrıca meraklı, Google Gemma açık modellerinin mimarisinde kullanılan katman başına yerleştirme (PLE) mekanizmasını uygulayarak 25 milyon parametrenin (12 MB) nispeten seyrek erişilen flash belleğe taşınmasını sağlarken yalnızca 2 MB veriyi denetleyicinin RAM'ine yerleştirdi. Sonuç olarak, giriş başlıkları ve anahtar-değer (KV) önbelleği PSRAM'a yerleştirildi ve 520 KB SRAM aktivasyon için yeterli oldu. Bu önlemler, ortalama bir insanın okuyabileceğinden daha hızlı olan saniyede 9.88 token üretim hızına ulaşılmasını sağladı. TinyStories harika bir konsept gösterimi ancak yalnızca kısa hikayeler üretiyor ve bir sohbet robotu için bile yetersiz. Benzer boyuttaki Barista modeli soruları yanıtlayabiliyor, tokenları iki kat daha hızlı üretiyor, ancak yalnızca espresso ile ilgili konularda. Her iki model de diğer görevler için çok küçük, ancak bir ESP32 üzerinde çalışmaları etkileyici.
Kaynak: 3DNews — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler