Perangkat Keras & InferensiModel 🇷🇺 13.08.2026 15:01

Qwen3.5/3.6 pada VRAM 16 GB: Kuantisasi, Penyetelan Halus, Perbandingan, dan Sedikit tentang Gemma-4

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
Seorang pengembang menguji berbagai model terkuantisasi dan disetel halus (Qwen3.5/3.6, Gemma-4) secara lokal pada RTX 5060 Ti 16GB untuk memperbaiki bug dalam kode permainan mereka. Hasilnya menunjukkan bahwa kuantisasi rendah seperti IQ3 dapat berfungsi, tetapi kualitasnya bervariasi secara tidak terduga antar penyedia dan versi model. Penyetelan halus sebagian besar buruk, dengan satu pengecualian, dan penulis merekomendasikan untuk menguji pada tugas Anda sendiri daripada mempercayai tolok ukur.
Penulis, seorang programmer non-profesional, membuat game dengan bantuan AI dan memutuskan untuk menjalankan model secara lokal. Perangkat mereka adalah Ryzen 5 5600G dengan RAM 32GB dan RTX 5060 Ti 16GB. Mereka menguji banyak model, termasuk Qwen3.5 dan Qwen3.6 dalam berbagai kuantisasi (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), fine-tune dari Qwen3.5 dan Qwen3.6, serta Gemma-4 12b dalam QAT dan Q5K_S. Pengujian melibatkan perbaikan bug dalam game (pemotongan peta) dan membersihkan kode. Hasil yang menonjol: Qwen3.5 27b dalam UD-IQ3XXS berhasil, Qwen3.5 27b dalam Q3K_S berhasil dan bahkan mengoptimalkan kode, Qwen3.6 dalam IQ3_S juga berhasil, sementara Qwen3.6 dalam UD-IQ3XXS dan Q3K_S gagal dan merusak game. Gemma-4 12b QAT berhasil tetapi Q5K_S gagal. Fine-tune sebagian besar buruk, kecuali 'defiant fable' yang lebih cepat dan efisien. Penulis menemukan bahwa kualitas kuantisasi sangat bergantung pada penyedia (Unsloth vs mradermacher) dan bahwa kuantisasi i-matrix tidak selalu lebih baik. Penulis menyimpulkan bahwa menguji pada tugas Anda sendiri sangat penting, dan kuantisasi rendah seperti IQ3 bisa layak digunakan.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru