새 벤치마크 확인: AI 모델은 여전히 잘 보지 못한다
Moonshot AI
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Moonshot AI는 인지적 추론과 세계 지식에서 시각적 인식을 분리하는 벤치마크인 PerceptionBench를 도입했습니다. 테스트에서 GPT-5.6 Sol, Kimi K3, Claude Fable 5를 포함한 모든 주요 모델이 상당한 약점을 보였으며, 정확도가 60%를 넘지 못했습니다. 저자들은 많은 추론 오류가 실제로는 잘못된 시각적 인식에 기인한다고 결론지었으며, 이는 이전 연구 결과를 확인시켜 줍니다.
Moonshot AI, 팀이 Kimi를 개발한 곳, 시각적 다중 모달 언어 모델의 지각 능력을 단독으로 테스트하기 위해 설계된 벤치마크인 PerceptionBench를 공개했습니다. 일반적인 벤치마크와 달리 PerceptionBench는 시각을 열 가지 세부 하위 기술로 세분화하며, 각 질문은 추론이나 외부 지식 없이 보기만으로 답할 수 있습니다. 분류 체계는 실제 모델 오류에서 도출되었으며, 시각적 관계, 개수 세기, 속성, 깊이 및 3D, 위치 파악, 비교, 세밀한 인식, 맥락 통합, OCR, 환각과 같은 영역으로 분류됩니다. Moonshot AI는 내부 검증된 17,000개 이상의 문제 풀에서 3,000개의 질문을 공개했습니다. 16개의 최첨단 모델 중 최고 전체 정확도는 GPT-5.6 Sol의 59.7%이며, 그 뒤를 Kimi K3 (58.5%), Claude Fable 5 (57.2%), Gemini 3.1 Pro (56.2%)가 따릅니다. 오픈소스 모델은 상당히 뒤처집니다. 환각 범주는 평균적으로 가장 약합니다. GPT-5.6 Sol은 그곳에서 26.9%에 그친 반면, 더 약한 Gemini 3.5 Flash는 50.6%를 기록합니다. 저자들은 인지된 많은 추론 오류가 실제로 지각 수준에서 발생한다고 주장합니다. Moonshot AI는 이전에 WorldVQA를 공개하고 BabyVision에 기여했으며, 이들도 최첨단 모델이 기본적인 시각적 작업에 실패하고 인간이 그들을 능가한다는 것을 보여주었습니다. 연구자들은 이를 언어화 병목 현상 때문이라고 돌립니다.
출처: The Decoder (DE) —
원문
