Benchmark Baru Mengonfirmasi: Model AI Masih Melihat dengan Buruk
Moonshot AI
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Moonshot AI telah memperkenalkan PerceptionBench, sebuah benchmark yang mengisolasi persepsi visual dari penalaran dan pengetahuan dunia. Dalam pengujian, semua model terkemuka termasuk GPT-5.6 Sol, Kimi K3, dan Claude Fable 5 menunjukkan kelemahan signifikan, dengan tidak ada yang melebihi akurasi 60%. Para penulis menyimpulkan bahwa banyak kesalahan penalaran yang seharusnya sebenarnya disebabkan oleh persepsi visual yang salah, mengonfirmasi penelitian sebelumnya.
Moonshot AI, tim di balik Kimi, telah merilis PerceptionBench, sebuah tolok ukur yang dirancang untuk menguji persepsi visual pada model multimodal bahasa secara terisolasi. Tidak seperti tolok ukur umum, PerceptionBench memecah penglihatan menjadi sepuluh sub-keterampilan atomik, dengan setiap pertanyaan dapat dijawab hanya dengan melihat, tanpa penalaran atau pengetahuan eksternal. Taksonomi ini berasal dari kesalahan model nyata, dikategorikan ke dalam area seperti Relasi Visual, Penghitungan, Atribut, Kedalaman & 3D, Lokalisasi, Perbandingan, Pengenalan Butir Halus, Integrasi Konteks, OCR, dan Halusinasi. Moonshot AI menerbitkan 3.000 pertanyaan dari kumpulan internal lebih dari 17.000 pertanyaan terverifikasi. Di antara 16 model terdepan, akurasi keseluruhan tertinggi adalah 59,7% oleh GPT-5.6 Sol, diikuti oleh Kimi K3 pada 58,5%, Claude Fable 5 pada 57,2%, dan Gemini 3.1 Pro pada 56,2%. Model sumber terbuka tertinggal signifikan. Kategori halusinasi adalah yang terlemah rata-rata: GPT-5.6 Sol hanya mendapat 26,9% di sana, sementara Gemini 3.5 Flash yang lebih lemah mendapat 50,6%. Para penulis berpendapat bahwa banyak kesalahan penalaran yang dirasakan sebenarnya terjadi pada tingkat persepsi. Moonshot AI sebelumnya telah merilis WorldVQA dan berkontribusi pada BabyVision, yang juga menunjukkan model terdepan gagal dalam tugas visual dasar, dengan manusia mengungguli mereka. Para peneliti mengaitkan hal ini dengan hambatan verbalisasi.
Sumber: The Decoder (DE) —
asli
