Laitteisto ja päättelyMallit 🇷🇺 13.08.2026 15:01

Qwen3.5/3.6 16 Gt VRAM:ssa: kvantit, hienosäätö, vertailu ja hieman Gemma-4:stä

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
Kehittäjä testasi erilaisia kvantisoituja ja hienosäädettyjä malleja (Qwen3.5/3.6, Gemma-4) paikallisesti RTX 5060 Ti 16GB -näytönohjaimella korjatakseen bugeja pelikoodissaan. Tulokset osoittavat, että matalat kvantit kuten IQ3 voivat toimia, mutta laatu vaihtelee arvaamattomasti toimittajien ja malliversioiden välillä. Hienosäädöt ovat enimmäkseen heikkoja, yhtä poikkeusta lukuun ottamatta, ja kirjoittaja suosittelee testaamaan omilla tehtävillä eikä luottamaan vertailuarvoihin.
Kirjoittaja, joka ei ole ammattiohjelmoija, loi pelejä tekoälyn avustuksella ja päätti ajaa malleja paikallisesti. Hänen kokoonpanonsa oli Ryzen 5 5600G, 32 Gt RAM-muistia ja RTX 5060 Ti 16 Gt. Hän testasi kokonaisen valikoiman malleja, mukaan lukien Qwen3.5 ja Qwen3.6 eri kvantisoinneilla (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), Qwen3.5:n ja Qwen3.6:n hienosäätöjä sekä Gemma-4 12b QAT- ja Q5K_S-muodoissa. Testi sisälsi bugin korjaamisen pelissä (kartan leikkaantuminen) ja koodin siistimisen. Huomattavia tuloksia: Qwen3.5 27b UD-IQ3XXS-muodossa onnistui, Qwen3.5 27b Q3K_S-muodossa onnistui ja jopa optimoi koodia, Qwen3.6 IQ3_S-muodossa onnistui myös, kun taas Qwen3.6 UD-IQ3XXS- ja Q3K_S-muodoissa epäonnistui ja rikkoi pelin. Gemma-4 12b QAT onnistui, mutta Q5K_S epäonnistui. Hienosäädöt olivat enimmäkseen heikkoja, paitsi 'defiant fable', joka oli nopeampi ja tehokkaampi. Kirjoittaja havaitsi, että kvantisoinnin laatu riippuu vahvasti toimittajasta (Unsloth vs. mradermacher) ja että i-matriisi-kvantisoinnit eivät aina ole parempia. Kirjoittaja päättää, että testaaminen omilla tehtävillä on välttämätöntä, ja matalat kvantisoinnit, kuten IQ3, voivat olla käyttökelpoisia.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset