Phần cứng & Suy luậnMô hình 🇷🇺 13.08.2026 15:01

Qwen3.5/3.6 trên VRAM 16 GB: Định lượng, Tinh chỉnh, So sánh và một chút về Gemma-4

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
Một nhà phát triển đã thử nghiệm các mô hình định lượng và tinh chỉnh khác nhau (Qwen3.5/3.6, Gemma-4) cục bộ trên RTX 5060 Ti 16 GB để sửa lỗi trong mã trò chơi của họ. Kết quả cho thấy các định lượng thấp như IQ3 có thể hoạt động, nhưng chất lượng thay đổi không thể đoán trước giữa các nhà cung cấp và phiên bản mô hình. Các tinh chỉnh hầu hết kém, ngoại trừ một trường hợp, và tác giả khuyên nên thử nghiệm trên các tác vụ của riêng bạn thay vì tin tưởng vào các điểm chuẩn.
Tác giả, một lập trình viên không chuyên, đã tạo ra các trò chơi bằng sự trợ giúp của AI và quyết định chạy các mô hình cục bộ. Cấu hình của họ là Ryzen 5 5600G với 32GB RAM và RTX 5060 Ti 16GB. Họ đã thử nghiệm một bộ sưu tập các mô hình, bao gồm Qwen3.5 và Qwen3.6 với nhiều biến thể lượng tử hóa khác nhau (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), các phiên bản tinh chỉnh của Qwen3.5 và Qwen3.6, cũng như Gemma-4 12b ở các phiên bản QAT và Q5K_S. Bài kiểm tra bao gồm việc sửa lỗi trong trò chơi (sự cố cắt xén bản đồ) và dọn dẹp mã. Kết quả đáng chú ý: Qwen3.5 27b ở phiên bản UD-IQ3XXS thành công, Qwen3.5 27b ở Q3K_S thành công và thậm chí còn tối ưu hóa mã, Qwen3.6 ở IQ3_S cũng thành công, trong khi Qwen3.6 ở UD-IQ3XXS và Q3K_S thất bại và làm hỏng trò chơi. Gemma-4 12b QAT thành công nhưng Q5K_S thất bại. Các phiên bản tinh chỉnh phần lớn kém, ngoại trừ 'defiant fable' nhanh hơn và hiệu quả hơn. Tác giả nhận thấy chất lượng lượng tử hóa phụ thuộc rất nhiều vào nhà cung cấp (Unsloth so với mradermacher) và lượng tử hóa i-matrix không phải lúc nào cũng tốt hơn. Tác giả kết luận rằng việc tự kiểm tra trên các tác vụ của riêng bạn là rất quan trọng, và các mức lượng tử hóa thấp như IQ3 có thể khả dụng.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới