ModelosHardware e Inferencia 🇺🇸 14.08.2026 09:02

Needle 2: un modelo abierto de 45 millones de parámetros para llamada de herramientas en un binario de 14 MB

Cactus ComputeCactus Compute
Cactus Compute ha lanzado Needle 2, un modelo abierto de 45 millones de parámetros para llamada de herramientas, uso de dispositivos y extracción estructurada. El modelo se distribuye como un binario de 14 MB, funciona con unos 28 MB de RAM y logra un alto rendimiento en dispositivos de borde. Lidera en los benchmarks de Seal-Tools pero se queda atrás en BFCL v4.
Cactus Compute ha lanzado Needle 2, un modelo abierto de 45 millones de parámetros para llamada de herramientas, uso de dispositivos y extracción estructurada. Todo el modelo se distribuye como un único binario de 14 MB que ejecuta una sesión completa en aproximadamente 28 MB de RAM. Los pesos se entrenan y despliegan con cuantización CQ2-bit utilizando Cactus Quants, y el modelo está sellado dentro del motor C++ de la propia empresa, por lo que no hay tiempo de ejecución que instalar y no hay descarga en el momento de la inferencia. El rendimiento de decodificación reportado es de 500 tokens por segundo en una Raspberry Pi 5, de 400 a 1500 tokens por segundo en Meta Quest 3S y Apple Vision Pro, y de 300 a 700 tokens por segundo en teléfonos de menos de 200 dólares. La premisa de diseño es que mapear una frase desordenada a una firma de función tipada no necesita conocimiento del mundo ni prosa abierta, por lo que 45 millones de parámetros son suficientes. Needle 2 utiliza una arquitectura de Red de Atención Simple con un MLP de Hadamard, atención GQA, memoria clave-valor engrama y hiperconexiones de múltiples vías. Utiliza una ventana deslizante de 256 tokens y sumideros KV fijos para mantener la memoria cerca de 28 MB independientemente de la longitud de la conversación. El modelo incluye una cabeza de recuperación contrastiva que selecciona solo las cinco mejores herramientas cuando se declaran más de cinco, y cada respuesta lleva un valor de confianza. La evaluación en puntos de referencia públicos de llamada de funciones muestra que Needle 2 lidera ambas divisiones de Seal-Tools y publica una precisión del 98,3 por ciento en nombres de funciones en Mobile Actions, pero va por detrás en BFCL v4 en general, lo que Cactus atribuye a diferencias en la distribución.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas