微小AI模型比GPT-5.6 Luna便宜11倍,逻辑测试几乎持平
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab发布了其推理模型BDH-CQ的测试结果,该模型拥有1.5亿参数,在ARC-AGI-1基准测试中得分29.5%。其每项任务的计算成本为0.0007美元,比OpenAI的GPT-5.6 Luna便宜11倍,后者得分为34.2%,每项任务成本为0.008美元。该实验室认为,替代架构可以大幅提高成本效益。
Pathway Lab专注于不同于Transformer的架构,近日发布了其推理模型BDH-CQ的测试结果。该模型尽管仅有1.5亿参数,却在ARC-AGI-1基准测试中取得了29.5%的得分,而每项任务成本仅为0.0007美元。这比OpenAI的小型模型GPT-5.6 Luna便宜11倍,后者得分34.2%,即便在降价80%后,每项任务成本仍为0.008美元。相比之下,Anthropic的Claude Opus 5和谷歌的Gemini 3.1 Pro在同一测试中得分达到97%至98%,但每项任务成本在0.5至0.6美元之间,几乎是前者的近千倍。阿里巴巴的Qwen3 235B成本是BDH-CQ的三倍多,但表现却更差。该实验室表示,差异源于推理机制:目前大多数AI模型生成中间文本,消耗大量令牌,而BDH-CQ则通过“静默”运算在内存中解决问题。初步实验表明,BDH-CQ遵循与拥有10亿至6000亿参数的Transformer模型相当的标准扩展规律。Pathway计划攻克更艰巨的任务,包括数学推理、ARC-AGI-2测试,并最终对ARC-AGI-3进行全面评估,期望这种效率优势能够在更大规模和更复杂的问题上得以保持。
来源: 3DNews —
原文
