模型硬件与推理 🇺🇸 14.08.2026 09:02

Needle 2:一个开放45M参数的工具调用模型,体积仅14MB二进制文件

Cactus ComputeCactus Compute
Cactus Compute发布了Needle 2,这是一个开放45M参数的工具调用、设备使用和结构化提取模型。该模型以14MB二进制文件形式提供,运行时占用约28MB内存,在边缘设备上实现高吞吐量。它在Seal-Tools基准测试中领先,但在BFCL v4上稍逊一筹。
Cactus Compute 发布了 Needle 2,这是一个开源的 4500 万参数模型,用于工具调用、设备使用和结构化提取。整个模型以单个 14MB 的二进制文件形式提供,运行完整会话仅需约 28MB 内存。权重使用 Cactus Quants 在 CQ2 比特位下训练和部署,模型封装在公司自有的 C++ 引擎中,因此无需安装运行时,推理时也无需下载。据说在 Raspberry Pi 5 上的解码吞吐量为每秒 500 个令牌,在 Meta Quest 3S 和 Apple Vision Pro 上为每秒 400–1500 个令牌,在 200 美元以下的手机上为每秒 300–700 个令牌。设计前提是,将杂乱的句子映射到类型化函数签名不需要世界知识,也不需要开放式散文,因此 4500 万参数就足够了。Needle 2 使用简单注意力网络架构,包含 Hadamard MLP、GQA 注意力、engram 键值记忆和多通道超连接。它使用 256 个令牌的滑动窗口和固定的 KV 汇点,无论对话长度如何,内存都保持在 28MB 左右。该模型包含一个对比检索头,当声明超过五个工具时,只选择前五个工具,并且每个响应都带有置信度值。在公共函数调用基准上的评估显示,Needle 2 在 Seal-Tools 的数据分割中均领先,并在 Mobile Actions 上实现了 98.3 的函数名称准确率,但在整体 BFCL v4 上落后,Cactus 将此归因于分布差异。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻