Kimi K3在PAC1和ECOM1上的表现:204个任务的结果与失败分析
Moonshot AI
Moonshot AI于7月开源了Kimi K3。该模型在两个BitGN基准测试(PAC1和ECOM1)上接受了204个开放轨迹的测试。结果显示,模型在简单检索和计算方面表现强劲,但在多文件原子操作、不可信输入检查以及长表一致性方面频繁失败。
Moonshot AI 于 7 月 27 日发布了 Kimi K3 的开放权重及技术报告。为独立验证性能,该模型在两个 BitGN 任务集上运行:PAC1(文档、发票、收件箱、批处理文件变更)和 ECOM1(目录、库存、购物车、支付、退货、物流)。PAC1 得分 61/104(二元评分),ECOM1 得分 44.75/100(部分评分)。204 个开放轨迹允许检查每条命令及状态变化。在 PAC1 上,简单搜索和算术任务成功率 90%-92%,但出现了三种关键失败模式:违反精确模式(写出相似但错误的字段名)、非原子批处理操作(在完整集合验证前进行部分文件更改)以及非阻塞的不可信输入检查(检测到危险内容但操作仍执行)。在 ECOM1 上,精确 SKU 搜索和标准结账表现良好,但失败模式包括:多行报告中行间状态丢失、过度异常标记、读取隐私数据前未进行身份验证,以及因不可信输入导致的状态变化。优化任务(调度发货)生成了可行但次优的计划。与其他公开 BitGN 运行结果对比显示,Kimi K3 在简单任务上具有竞争力,但在复杂多步骤约束方面落后。
来源: Habr — хаб ИИ —
原文
