新基准测试证实:人工智能模型视觉能力仍然薄弱
Moonshot AI
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
月之暗面推出了PerceptionBench,这是一个将视觉感知与推理和世界知识分离的基准测试。测试中,包括GPT-5.6 Sol、Kimi K3和Claude Fable 5在内的所有领先模型均表现出明显弱点,准确率均未超过60%。作者得出结论,许多所谓的推理错误实际上是由视觉感知缺陷导致的,这证实了早期研究。
Moonshot AI,即Kimi背后的团队,发布了一个名为PerceptionBench的基准测试,旨在单独测试多模态语言模型中的视觉感知能力。与常见基准不同,PerceptionBench将视觉分解为十个原子性子技能,每个问题仅凭观察即可回答,无需推理或外部知识。该分类源自真实模型错误,涵盖视觉关系、计数、属性、深度与3D、定位、比较、细粒度识别、上下文整合、OCR和幻觉等领域。Moonshot AI从内部超过17,000个已验证问题中发布了3,000个问题。在16个前沿模型中,总体准确率最高的是GPT-5.6 Sol,达到59.7%,其次是Kimi K3(58.5%)、Claude Fable 5(57.2%)和Gemini 3.1 Pro(56.2%)。开源模型明显落后。幻觉类别平均表现最弱:GPT-5.6 Sol仅获得26.9%,而较弱的Gemini 3.5 Flash则达到50.6%。作者认为,许多被认为的推理错误实际上发生在感知层面。Moonshot AI此前发布了WorldVQA,并为BabyVision做出了贡献,后者也显示前沿模型在基本视觉任务上失败,而人类表现优于它们。研究人员将此归因于言语化瓶颈。
来源: The Decoder (DE) —
原文
