모델하드웨어 및 추론 🇺🇸 14.08.2026 09:02

니들 2: 14MB 바이너리로 제공되는 오픈 4500만 파라미터 도구 호출 모델

Cactus ComputeCactus Compute
캑터스 컴퓨트가 도구 호출, 기기 사용, 구조화 추출을 위한 오픈 4500만 파라미터 모델인 니들 2를 출시했다. 이 모델은 14MB 바이너리로 제공되며, 약 28MB RAM에서 실행되고 엣지 디바이스에서 높은 처리량을 달성한다. 시울 툴 벤치마크에서는 선두를 차지했지만 BFCL v4에서는 뒤처진다.
Cactus Compute가 Needle 2를 출시했습니다. 도구 호출, 기기 사용, 구조화된 추출을 위한 오픈 4500만 파라미터 모델입니다. 전체 모델은 단일 14MB 바이너리로 제공되며, 약 28MB의 RAM에서 전체 세션을 실행합니다. 가중치는 Cactus Quants를 사용해 CQ2 비트로 학습 및 배포되며, 모델은 자체 C++ 엔진 내부에 봉인되어 있어 런타임 설치가 필요 없고 추론 시 다운로드도 없습니다. 보고된 디코딩 처리량은 Raspberry Pi 5에서 초당 500토큰, Meta Quest 3S 및 Apple Vision Pro에서 초당 400~1,500토큰, 200달러 미만 휴대폰에서 초당 300~700토큰입니다. 설계 전제는 지저분한 문장을 형식화된 함수 시그니처에 매핑하는 데는 세계 지식이나 개방형 산문이 필요 없으므로 4500만 파라미터면 충분하다는 것입니다. Needle 2는 Hadamard MLP, GQA 어텐션, 엔그램 키-값 메모리, 다중 레인 하이퍼 커넥션을 갖춘 단순 어텐션 네트워크 아키텍처를 사용합니다. 256토큰 슬라이딩 윈도우와 고정 KV 싱크를 사용하여 대화 길이에 관계없이 메모리를 약 28MB로 유지합니다. 모델에는 5개 이상의 도구가 선언된 경우 상위 5개 도구만 선택하는 대조 검색 헤드가 포함되어 있으며, 모든 응답에는 신뢰도 값이 함께 제공됩니다. 공개 함수 호출 벤치마크 평가에서 Needle 2는 Seal-Tools 분할 모두에서 선두를 달리고 Mobile Actions에서 함수 이름 정확도 98.3을 기록했지만, Cactus가 분포 차이로 돌린 BFCL v4 전체에서는 뒤쳐집니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스