ModèlesMatériel et Inférence 🇺🇸 14.08.2026 09:02

Needle 2 : un modèle open source de 45 millions de paramètres pour l'appel d'outils dans un binaire de 14 Mo

Cactus ComputeCactus Compute
Cactus Compute a publié Needle 2, un modèle open source de 45 millions de paramètres pour l'appel d'outils, l'utilisation d'appareils et l'extraction structurée. Le modèle est fourni sous forme de binaire de 14 Mo, fonctionne dans environ 28 Mo de RAM et atteint un débit élevé sur les appareils de périphérie. Il est en tête des benchmarks Seal-Tools mais est en retrait sur BFCL v4.
Cactus Compute a publié Needle 2, un modèle open source de 45 millions de paramètres destiné à l'appel d'outils, à l'utilisation d'appareils et à l'extraction structurée. L'ensemble du modèle est fourni sous la forme d'un binaire unique de 14 Mo qui exécute une session complète dans environ 28 Mo de RAM. Les poids sont entraînés et déployés en CQ2-bit à l'aide de Cactus Quants, et le modèle est scellé dans le moteur C++ propriétaire de l'entreprise, de sorte qu'il n'y a ni environnement d'exécution à installer ni téléchargement au moment de l'inférence. Le débit de décodage annoncé est de 500 tokens par seconde sur un Raspberry Pi 5, de 400 à 1 500 tokens par seconde sur Meta Quest 3S et Apple Vision Pro, et de 300 à 700 tokens par seconde sur des téléphones à moins de 200 dollars. Le principe de conception est que le mappage d'une phrase désordonnée sur une signature de fonction typée ne nécessite ni connaissance du monde ni prose ouverte, donc 45 millions de paramètres suffisent. Needle 2 utilise une architecture de réseau d'attention simple avec un MLP de Hadamard, une attention GQA, une mémoire clé-valeur engramme et des hyper-connexions multi-voies. Il utilise une fenêtre glissante de 256 tokens et des puits KV épinglés pour maintenir la mémoire proche de 28 Mo quelle que soit la longueur de la conversation. Le modèle comprend une tête de récupération contrastive qui ne sélectionne que les cinq premiers outils lorsque plus de cinq sont déclarés, et chaque réponse est accompagnée d'une valeur de confiance. L'évaluation sur des benchmarks publics d'appel de fonctions montre que Needle 2 mène sur les deux divisions Seal-Tools et affiche une précision de 98,3 % sur les noms de fonctions dans Mobile Actions, mais est en retrait sur l'ensemble BFCL v4, ce que Cactus attribue à des différences de distribution.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches