Qwen3.5/3.6 на 16 ГБ видеопамяти: квантование, дообучение, сравнение и немного о Gemma-4

Alibaba/Qwen Google/DeepMind Unsloth
Разработчик протестировал различные квантованные и дообученные модели (Qwen3.5/3.6, Gemma-4) локально на RTX 5060 Ti с 16 ГБ видеопамяти, чтобы исправить ошибки в своём игровом коде. Результаты показывают, что низкие квантования, такие как IQ3, могут работать, но качество непредсказуемо варьируется между провайдерами и версиями моделей. Дообученные модели в основном плохие, за одним исключением, и автор рекомендует тестировать на собственных задачах, а не доверять бенчмаркам.
Автор, программист-любитель, создавал игры с помощью ИИ и решил запускать модели локально. Его конфигурация: Ryzen 5 5600G, 32 ГБ ОЗУ и RTX 5060 Ti 16 ГБ. Он протестировал целый зоопарк моделей, включая Qwen3.5 и Qwen3.6 в различных квантах (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), тонкие настройки Qwen3.5 и Qwen3.6, а также Gemma-4 12b в QAT и Q5K_S. Тест заключался в исправлении ошибки в игре
Показать ещё ↓
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости