ModelosHardware e Inferência 🇺🇸 14.08.2026 09:02

Needle 2: um modelo aberto de 45 milhões de parâmetros para chamada de ferramentas em um binário de 14MB

Cactus ComputeCactus Compute
A Cactus Compute lançou o Needle 2, um modelo aberto de 45 milhões de parâmetros para chamada de ferramentas, uso de dispositivos e extração estruturada. O modelo vem em um binário de 14MB, roda em cerca de 28MB de RAM e alcança alta produtividade em dispositivos de borda. Ele lidera nos benchmarks Seal-Tools, mas fica atrás no BFCL v4.
A Cactus Compute lançou o Needle 2, um modelo aberto de 45 milhões de parâmetros para chamada de ferramentas, uso de dispositivos e extração estruturada. O modelo inteiro vem em um único binário de 14MB que executa uma sessão completa em cerca de 28MB de RAM. Os pesos são treinados e implantados em CQ2-bit usando Cactus Quants, e o modelo é lacrado no motor C++ da própria empresa, então não há runtime para instalar e nenhum download no momento da inferência. A taxa de transferência de decodificação relatada é de 500 tokens por segundo em um Raspberry Pi 5, 400–1.500 tokens por segundo no Meta Quest 3S e Apple Vision Pro, e 300–700 tokens por segundo em celulares abaixo de US$ 200. A premissa do design é que mapear uma frase confusa para uma assinatura de função tipada não precisa de conhecimento de mundo nem de prosa aberta, então 45 milhões de parâmetros são suficientes. O Needle 2 usa uma arquitetura de Rede de Atenção Simples com um MLP de Hadamard, atenção GQA, memória de chave-valor engram e hiperconexões de múltiplas vias. Ele usa uma janela deslizante de 256 tokens e sumidouros de chave-valor fixados para manter a memória perto de 28MB, independentemente do comprimento da conversa. O modelo inclui uma cabeça de recuperação contrastiva que seleciona apenas as cinco principais ferramentas quando mais de cinco são declaradas, e cada resposta carrega um valor de confiança. A avaliação em benchmarks públicos de chamada de função mostra que o Needle 2 lidera ambas as divisões de Seal-Tools e atinge 98,3 de precisão de nome de função em Mobile Actions, mas fica atrás no BFCL v4 geral, o que a Cactus atribui a diferenças de distribuição.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas