Tutkimus 🇩🇪 15.08.2026 09:01

Uusi vertailutesti vahvistaa: tekoälymallit näkevät edelleen huonosti

Moonshot AIMoonshot AI OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Moonshot AI on esitellyt PerceptionBenchin, vertailutestin, joka eristää visuaalisen havaitsemisen päättelystä ja maailmantiedosta. Testeissä kaikki johtavat mallit, mukaan lukien GPT-5.6 Sol, Kimi K3 ja Claude Fable 5, osoittivat merkittäviä heikkouksia, eikä yksikään ylittänyt 60 prosentin tarkkuutta. Kirjoittajat päättelevät, että monet oletetut päättelyvirheet johtuvat itse asiassa virheellisestä visuaalisesta havaitsemisesta, mikä vahvistaa aikaisemmat tutkimukset.
Moonshot AI, Kimin taustatiimi, on julkaissut PerceptionBench-mittarin, joka on suunniteltu testaamaan visuaalista havaitsemista multimodaalisissa kielimalleissa eristyksissä. Toisin kuin tavalliset mittarit, PerceptionBench jakaa näön kymmeneen atomiseen osataitoon, ja jokainen kysymys on vastattavissa pelkästään katsomalla, ilman päättelyä tai ulkoista tietoa. Luokittelu on johdettu oikeista mallivirheistä ja se on jaettu alueisiin, kuten visuaalinen suhde, laskeminen, attribuutit, syvyys ja kolmiulotteisuus, paikannus, vertailu, hienojakoinen tunnistus, kontekstin integrointi, OCR ja hallusinaatio. Moonshot AI julkaisi 3 000 kysymystä yli 17 000 varmennetun kysymyksen sisäisestä poolista. 16 huippumallin joukossa korkein kokonaistarkkuus on GPT-5.6 Solilla 59,7 prosenttia, seuraavina Kimi K3 58,5 prosentilla, Claude Fable 5 57,2 prosentilla ja Gemini 3.1 Pro 56,2 prosentilla. Avoimen lähdekoodin mallit jäävät merkittävästi jälkeen. Hallusinaatiokategoria on keskimäärin heikoin: GPT-5.6 Sol saa siellä vain 26,9 prosenttia, kun taas heikompi Gemini 3.5 Flash saa 50,6 prosenttia. Kirjoittajat väittävät, että monet havaitut päättelyvirheet tapahtuvat itse asiassa havaitsemisen tasolla. Moonshot AI oli aiemmin julkaissut WorldVQA:n ja osallistunut BabyVisioniin, joka myös osoitti huippumallien epäonnistuvan perustason visuaalisissa tehtävissä, kun taas ihmiset suoriutuvat niitä paremmin. Tutkijat selittävät tämän verbalisaatiopullonkaulalla.
Lähde: The Decoder (DE) — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset