Nghiên cứuMô hình 🇷🇺 01.08.2026 20:01

Lượng tử hóa rời rạc: Biên giới tiếp theo trong việc nén mạng nơ-ron

PrismMLPrismML
Bài viết khám phá sự chuyển dịch từ các kỹ thuật lượng tử hóa cổ điển sang lượng tử hóa rời rạc, nơi các trọng số được giới hạn trong một tập nhỏ các giá trị (nhị phân, tam phân). Bài viết nêu bật dòng mô hình Bonsai 27B từ PrismML, sử dụng các phiên bản nhị phân và tam phân của Qwen 3.6 27B, đạt được mức nén lên tới 14 lần trong khi vẫn giữ được một phần đáng kể khả năng của mô hình gốc. Tác giả thử nghiệm phiên bản tam phân, ghi nhận suy luận nhanh hơn nhưng hiệu suất giảm không đều trong các tác vụ phức tạp, và thảo luận về các tác động thực tế khi chạy các mô hình lớn trên phần cứng tiêu dùng.
Bài viết bắt đầu bằng việc thảo luận về sự phát triển của kỹ thuật lượng tử hóa (quantization) mạng nơ-ron, từ các định dạng dấu chấm động (floating-point) truyền thống chuyển sang các kiểu số nguyên như INT8 và INT4, rồi tiến đến lượng tử hóa rời rạc với trọng số nhị phân (1-bit) và trọng số tam phân (1,58-bit). Cách tiếp cận này giúp giảm mạnh kích thước mô hình và cho phép triển khai trên phần cứng phổ thông dành cho người dùng cá nhân. Dòng mô hình Bonsai 27B của PrismML, được xây dựng trên nền Qwen 3.6 27B, cung cấp các phiên bản nhị phân và tam phân chỉ chiếm dung lượng 3,8 GB và 7,17 GB, so với 53,8 GB của bản gốc. Công ty tuyên bố có thể giữ lại tới 90–95% năng lực ban đầu của mô hình, nhưng theo các bài kiểm tra của tác giả, con số thực tế chỉ khoảng 75% đối với các bài toán toán học và lập trình, và 60% đối với các tác vụ gọi hàm (function calling) phức tạp liên quan đến nhiều tác tử (multi-agent), tuy vậy đây vẫn là một kết quả đáng ấn tượng đối với một mô hình nhỏ hơn tới 10 lần. Tác giả cũng ghi nhận rằng phiên bản tam phân thậm chí vượt trội hơn bản gốc về tốc độ, tạo văn bản nhanh hơn. Bên cạnh đó, một bộ soạn thảo suy đoán (speculative drafter) có tên DSpark được tích hợp nhằm tăng tốc độ sinh văn bản lên 35% mà không làm giảm chất lượng. Tuy nhiên, mô hình này yêu cầu một bản fork đặc biệt của llama.cpp do sử dụng các định dạng lượng tử hóa không theo chuẩn thông thường, và tác giả đã trình bày chi tiết cách biên dịch (build) và chạy bản fork này. Tác giả kết luận rằng đây là một thành tựu đáng kể, mang lại chất lượng tương đương với các mô hình lượng tử hóa lớn hơn trong khi vẫn vừa với dung lượng VRAM nhỏ hơn nhiều, phù hợp để triển khai cục bộ (local deployment) và thậm chí có khả năng chạy trên các thiết bị di động như iPhone 17 Pro Max.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới