이산 양자화: 신경망 압축의 새로운 지평
PrismML
이 기사는 고전적인 양자화 기법에서 이산 양자화로의 전환을 탐구합니다. 이산 양자화에서는 가중치가 이진수나 삼진수와 같은 소수의 값으로 제한됩니다. PrismML의 Bonsai 27B 모델 제품군을 강조하며, Qwen 3.6 27B의 이진 및 삼진 버전을 사용하여 최대 14배 압축을 달성하면서도 원래 모델의 상당 부분의 성능을 유지합니다. 저자는 삼진 버전을 테스트하여 더 빠른 추론을 확인했지만 복잡한 작업에서는 성능 저하가 고르지 않음을 지적하고, 소비자 하드웨어에서 대규모 모델을 실행하기 위한 실질적인 의미를 논의합니다.
이 기사는 신경망 양자화의 진화를 논하는 것으로 시작하는데, 기존의 부동 소수점 형식에서 INT8 및 INT4와 같은 정수 타입으로, 그리고 이진(1비트) 및 삼진(1.58비트) 가중치를 사용하는 이산 양자화로의 전환을 다룹니다. 이러한 접근 방식은 모델 크기를 급격히 줄여 소비자 하드웨어에서의 배포를 가능하게 합니다. PrismML의 Bonsai 27B 제품군은 Qwen 3.6 27B를 기반으로 하며, 이진 및 삼진 버전은 각각 3.8GB와 7.17GB를 차지하는 반면, 원본은 53.8GB입니다. 회사는 원본 기능의 최대 90~95% 보존을 주장하지만, 저자의 테스트에서는 수학 및 코딩에서 약 75%, 복잡한 다중 에이전트 함수 호출에서 60%를 보여주며, 10배 더 작은 모델임에도 불구하고 여전히 인상적이라고 언급합니다. 저자는 삼진 모델이 원본보다 속도 면에서 우수하여 텍스트 생성이 더 빠르다고 지적합니다. 또한, 추측적 드래프터 DSpark가 포함되어 품질 저하 없이 생성 속도를 35% 향상시킵니다. 그러나 이 모델은 비표준 양자화 형식으로 인해 특수한 llama.cpp 포크를 필요로 하며, 저자는 이를 빌드하고 실행하는 방법을 시연합니다. 저자는 이것이 상당한 성과를 나타내며, 더 큰 양자화 모델과 비교할 수 있는 품질을 제공하면서도 더 작은 VRAM에 맞출 수 있어 로컬 배포에 적합하고, 잠재적으로 iPhone 17 Pro Max와 같은 모바일 기기에서도 사용할 수 있다고 결론짓습니다.
출처: Habr — хаб ИИ —
원문
