Novo benchmark confirma: modelos de IA ainda enxergam mal
Moonshot AI
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
A Moonshot AI introduziu o PerceptionBench, um benchmark que isola a percepção visual do raciocínio e do conhecimento de mundo. Nos testes, todos os principais modelos, incluindo GPT-5.6 Sol, Kimi K3 e Claude Fable 5, mostraram fraquezas significativas, com nenhum excedendo 60% de precisão. Os autores concluem que muitos supostos erros de raciocínio são na verdade causados por percepção visual defeituosa, confirmando estudos anteriores.
A Moonshot AI, equipe por trás do Kimi, lançou o PerceptionBench, um benchmark projetado para testar a percepção visual em modelos de linguagem multimodais de forma isolada. Diferente de benchmarks comuns, o PerceptionBench divide a visão em dez sub-habilidades atômicas, com cada pergunta sendo respondida apenas pela observação, sem raciocínio ou conhecimento externo. A taxonomia foi derivada de erros reais de modelos, categorizados em áreas como Relação Visual, Contagem, Atributo, Profundidade e 3D, Localização, Comparação, Reconhecimento de Granulação Fina, Integração de Contexto, OCR e Alucinação. A Moonshot AI publicou 3.000 perguntas de um pool interno de mais de 17.000 verificadas. Entre 16 modelos de fronteira, a maior precisão geral é de 59,7% do GPT-5.6 Sol, seguido pelo Kimi K3 com 58,5%, Claude Fable 5 com 57,2% e Gemini 3.1 Pro com 56,2%. Modelos de código aberto ficam significativamente atrás. A categoria de alucinação é a mais fraca em média: o GPT-5.6 Sol obtém apenas 26,9% lá, enquanto o Gemini 3.5 Flash, mais fraco, obtém 50,6%. Os autores argumentam que muitos erros percebidos como de raciocínio na verdade ocorrem no nível da percepção. A Moonshot AI havia lançado anteriormente o WorldVQA e contribuído para o BabyVision, que também mostraram que modelos de fronteira falham em tarefas visuais básicas, com humanos os superando. Os pesquisadores atribuem isso a um gargalo de verbalização.
Fonte: The Decoder (DE) —
original
