сама модель заключена в собственный C++-движок компании, поэтому не требует установки среды выполнения и не загружает данные при выводе. Заявленная пропускная способность декодирования составляет 500 токенов в секунду на Raspberry Pi 5, 400–1500 токенов в секунду на Meta Quest 3S и Apple Vision Pro, а также 300–700 токенов в секунду на смартфонах стоимостью до 200 долларов. Исходная предпосылка проекта заключается в том, что для сопоставления неструктурированного предложения с типизированной сигнатурой функции не требуется ни знаний о мире, ни свободного порождения текста, поэтому 45 миллионов параметров достаточно. Needle 2 использует архитектуру Simple Attention Network с MLP Адамара, вниманием GQA (групповое запросное внимание), энграммной ключ-значение памятью и многоканальными гиперсвязями. Модель использует скользящее окно на 256 токенов и закрепленные KV-якоря, что позволяет удерживать потребление памяти около 28 МБ независимо от длины разговора. Модель включает контрастивную головку поиска, которая выбирает только пять лучших инструментов, если объявлено более пяти, и каждый ответ сопровождается значением уверенности. Оценка на публичных бенчмарках для вызова функций показывает, что Needle 2 лидирует в обеих частях набора Seal-Tools и достигает 98,3% точности имен функций на Mobile Actions, но отстает в общем зачете BFCL v4, что Cactus объясняет различиями в распределении данных.