Nunchaku Lite, 4비트 확산 추론을 Diffusers에 도입
Hugging Face
Baidu
Nunchaku Lite는 Hugging Face Diffusers의 새로운 통합 기능으로, 사용자 정의 파이프라인이나 로컬 CUDA 컴파일 없이 간단한 from_pretrained() 호출로 4비트 양자화된 확산 모델을 로드할 수 있습니다. VRAM을 최대 50% 절감하고 추론 속도를 약 1.35배 향상시키며, torch.compile을 통해 추가적인 성능 향상을 얻을 수 있습니다.
Nunchaku Lite는 Hugging Face Diffusers의 새로운 통합 경로로, 인기 있는 Nunchaku 추론 엔진의 기반이 되는 SVDQuant 양자화 방법을 사용하여 확산 모델에 4비트 추론을 제공합니다. 표준 가중치 전용 양자화와 달리, SVDQuant는 주요 트랜스포머 레이어를 4비트 가중치와 활성화(W4A4)로 실행하여 메모리를 줄이고 잡음 제거 루프를 가속화합니다. Nunchaku Lite를 사용하면 Hugging Face 커널 패키지 덕분에 로컬 CUDA 컴파일 없이 from_pretrained()를 호출하는 것만으로 양자화된 체크포인트를 로드할 수 있습니다. 두 가지 커널 패밀리가 사용됩니다: 어텐션 및 MLP 프로젝션용 svdq_w4a4(INT4 및 NVFP4 변형 제공)와 정규화 레이어용 awq_w4a16. NVFP4 체크포인트는 NVIDIA Blackwell GPU(RTX 50 시리즈, RTX PRO 6000, B200)가 필요하며, INT4 변형은 Turing/Ampere/Ada GPU(RTX 30 및 40 시리즈, A100, L40S)를 지원합니다. RTX PRO 6000에서의 벤치마크 결과, BF16 기준선 대비 1.35배 속도 향상과 최대 50% VRAM 감소를 보여주었으며, torch.compile과 결합하면 1.8배 속도 향상을 제공합니다. 함께 제공되는 diffuse-compressor 툴킷을 사용하면 사용자가 자신의 모델을 양자화하여 일반 Diffusers 저장소로 게시할 수 있습니다.
출처: Hugging Face blog —
원문
