Phần cứng & Suy luậnNghiên cứu 🇷🇺 05.08.2026 17:01

Mô Hình AI Có Thể Chạy Trên Mọi Thiết Bị: Người Đam Mê Chạy LLM Trên Vi Điều Khiển 10 Đô La

Microsoft ResearchMicrosoft Research
Một người đam mê có biệt danh SlvDev đã thành công trong việc chạy một mô hình ngôn ngữ lớn cục bộ trên vi điều khiển ESP32-S3 chỉ có giá 10 đô la Mỹ, đạt tốc độ khoảng 10 token mỗi giây. Dự án bao gồm việc lượng tử hóa và sử dụng nhúng từng lớp để phù hợp với bộ nhớ hạn chế của thiết bị.
Vào năm 2026, các mô hình ngôn ngữ lớn có thể được chạy cục bộ trên laptop và cả trên điện thoại thông minh, nhưng một người đam mê công nghệ với biệt danh SlvDev đã tiến xa hơn khi chạy một mô hình ngôn ngữ nhỏ trên vi điều khiển ESP32-S3 có giá 10 USD, đạt tốc độ xử lý gần 10 token mỗi giây. ESP32-S3 có 520 KB SRAM (bộ nhớ truy cập ngẫu nhiên tĩnh) và 8 MB PSRAM (bộ nhớ giả SRAM), được thiết kế để điều khiển các cảm biến từ xa, thiết bị IoT (Internet vạn vật) và các thiết bị khác, nhưng việc chạy một thứ như DeepSeek V4 Flash là điều không thể. Thay vào đó, SlvDev chọn TinyStories, một mô hình do Microsoft Research phát triển với 28,9 triệu tham số, nhỏ gọn hơn khoảng 10.000 lần. Ngay cả mô hình này ban đầu cũng cần khoảng 60 MB dung lượng ở độ chính xác 16-bit, quá lớn đối với ESP32-S3. Do đó, tác giả đã lượng tử hóa mô hình, nén trọng số từ 16 bit xuống 8 bit, rồi xuống 4 bit, giảm kích thước mô hình xuống còn 14,9 MB, đòi hỏi phải dùng phiên bản vi điều khiển có 16 MB bộ nhớ flash. Hơn nữa, người đam mê này đã triển khai cơ chế nhúng theo lớp (per-layer embedding - PLE) được sử dụng trong kiến trúc của các mô hình mở Google Gemma, cho phép chuyển 25 triệu tham số (12 MB) sang bộ nhớ flash, nơi được truy cập tương đối ít, trong khi chỉ 2 MB dữ liệu được đặt trong RAM của vi điều khiển. Kết quả là các tiêu đề đầu vào và bộ nhớ đệm khóa-giá trị (key-value cache - KV cache) được đặt trong PSRAM, và 520 KB SRAM đã đủ cho việc kích hoạt. Những biện pháp này đã đạt được tốc độ sinh văn bản 9,88 token mỗi giây, nhanh hơn tốc độ đọc trung bình của một người. TinyStories là một minh chứng khái niệm tuyệt vời nhưng chỉ tạo ra những câu chuyện ngắn, chưa đủ để dùng cho một chatbot. Mô hình Barista có kích thước tương tự có thể trả lời câu hỏi, tạo token nhanh gấp đôi, nhưng chỉ về các chủ đề liên quan đến espresso. Cả hai mô hình đều quá nhỏ để thực hiện các nhiệm vụ khác, nhưng việc chúng có thể chạy được trên ESP32 vẫn là điều đáng ấn tượng.
Nguồn: 3DNews — bản gốc
Bài viết liên quan trước đây ↓
Tin mới