16GB VRAM에서의 Qwen3.5/3.6: 퀀트, 파인튜닝, 비교, 그리고 Gemma-4에 대한 약간의 이야기
Alibaba/Qwen
Google/DeepMind
Unsloth
한 개발자가 RTX 5060 Ti 16GB에서 다양한 양자화 및 파인튜닝 모델(Qwen3.5/3.6, Gemma-4)을 로컬로 테스트하여 게임 코드의 버그를 수정했습니다. 결과적으로 IQ3와 같은 낮은 양자화도 작동할 수 있지만, 품질은 제공자와 모델 버전에 따라 예측할 수 없게 다양합니다. 파인튜닝은 대부분 성능이 낮았으며, 한 가지 예외가 있었고, 저자는 벤치마크를 신뢰하기보다는 자신의 작업에 대해 테스트할 것을 권장합니다.
저자는 비전문 프로그래머로서 AI의 도움을 받아 게임을 만들다가 모델을 로컬에서 실행하기로 결정했습니다. 그들의 시스템은 Ryzen 5 5600G와 32GB RAM, RTX 5060 Ti 16GB로 구성되었습니다. 그들은 Qwen3.5와 Qwen3.6의 다양한 양자화 버전(IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), Qwen3.5와 Qwen3.6의 파인튠 버전, 그리고 Gemma-4 12b의 QAT 및 Q5K_S 버전을 포함한 다양한 모델을 테스트했습니다. 테스트는 게임의 버그(맵 잘림 현상)를 수정하고 코드를 정리하는 작업이었습니다. 주목할 만한 결과는 다음과 같습니다: Qwen3.5 27b의 UD-IQ3XXS 버전이 성공했고, Qwen3.5 27b의 Q3K_S 버전은 성공했을 뿐만 아니라 코드를 최적화하기도 했습니다. Qwen3.6의 IQ3_S 버전도 성공했지만, Qwen3.6의 UD-IQ3XXS와 Q3K_S 버전은 실패하여 게임을 망가뜨렸습니다. Gemma-4 12b의 QAT 버전은 성공했지만 Q5K_S 버전은 실패했습니다. 파인튠 버전은 대부분 성능이 좋지 않았지만, 'defiant fable'은 더 빠르고 효율적이었습니다. 저자는 양자화 품질이 공급자(Unsloth 대 mradermacher)에 크게 좌우되며, i-매트릭스 양자화가 항상 더 나은 것은 아니라는 점을 발견했습니다. 저자는 자신의 작업에 맞춰 테스트하는 것이 필수적이며, IQ3과 같은 낮은 양자화도 실용적일 수 있다고 결론지었습니다.
출처: Habr — хаб ИИ —
원문
