모델하드웨어 및 추론 🇺🇸 11.08.2026 08:03

Meta AI, 소비자 GPU용 30B 오픈 가중치 에이전트 모델 '뮤즈 글리머' 공개

MetaMeta Alibaba/QwenAlibaba/Qwen
Meta가 Muse Spark에서 증류한 30억 파라미터 멀티모달 모델 Muse Glimmer를 Apache 2.0 라이선스로 공개했습니다. 4비트 양자화와 DFlash 추측 디코딩을 통해 단일 소비자 GPU나 Mac에서 실행 가능하며, 로컬 에이전트 워크플로를 지원합니다.
메타가 뮤즈 글리머를 출시했다. 이는 뮤즈 스파크에서 증류한 300억 파라미터의 멀티모달 모델로, 상시 가동되는 로컬 에이전트 워크플로우에 맞춰 조정되었으며 아파치 2.0 라이선스로 배포된다. 전체 정밀도에서 300억 모델은 55GB 이상의 메모리가 필요하지만, 메타는 이를 약 4비트 정밀도로 압축하고 블록 수준의 추측 디코딩을 추가하여 네트워크 호출 없이 소비자용 GPU 하나 또는 맥에서 실행할 수 있게 했다. 허깅페이스 컬렉션에는 BF16 가중치, GGUF k-퀀트, ExecuTorch 빌드, DFlash 드래프터가 포함된다. 뮤즈 글리머는 지각 인코더를 갖춘 조밀한 인과 트랜스포머로, 32개의 쿼리 헤드와 2개의 KV 헤드를 가진 그룹 쿼리 어텐션을 사용하며 컨텍스트 길이는 131,072 이상이다. 학습은 뮤즈 스파크의 출력에 대한 로짓 증류, 긴 컨텍스트의 에이전트 중심 데이터를 사용한 중간 학습, 지도 미세 조정과 강화 학습을 통한 사후 학습을 포함한다. 압축 버전은 언어 모델이 20GB 미만을 차지하여 24GB 또는 32GB 메모리 환경에 맞는다. K-퀀트-다이내믹은 32GB VRAM을 대상으로 평균 0.2%의 성능 저하를, K-퀀트-17GB는 24GB VRAM을 대상으로 1.0%의 성능 저하를 보이는 두 가지 양자화 빌드가 제공된다. DFlash는 블록 확산 드래프터로, 한 번의 순방향 패스로 16개의 토큰을 예측하여 RTX 5090에서 3.1배의 속도 향상을 달성한다. 벤치마크에서 뮤즈 글리머는 MCP Atlas(75.5), DeepSearch QA(74.6), Gaia2(43.3), SWE-Bench Pro(51.2), AIME 2026(94.7)에서 선두를 차지했지만, OSWorld-Verified(65.9 대 75.6)와 TerminalBench 2.1에서는 Qwen3.6-27B에 뒤처진다. 안전성 측면에서 Siren AgentDojo 공격 성공률은 28.4, 유틸리티는 94.2이며, 메타는 화학/생물, 사이버, 통제 상실 위험을 중간 또는 낮음으로 평가한다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스