Investigación 🇩🇪 15.08.2026 09:01

Nuevo benchmark confirma: los modelos de IA aún ven mal

Moonshot AIMoonshot AI OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Moonshot AI ha presentado PerceptionBench, un benchmark que aísla la percepción visual del razonamiento y el conocimiento del mundo. En las pruebas, todos los modelos líderes, incluidos GPT-5.6 Sol, Kimi K3 y Claude Fable 5, mostraron debilidades significativas, sin superar ninguno el 60% de precisión. Los autores concluyen que muchos supuestos errores de razonamiento son en realidad causados por una percepción visual defectuosa, lo que confirma estudios anteriores.
Moonshot AI, el equipo detrás de Kimi, ha lanzado PerceptionBench, un punto de referencia diseñado para evaluar la percepción visual en modelos de lenguaje multimodales de forma aislada. A diferencia de los puntos de referencia comunes, PerceptionBench descompone la visión en diez subhabilidades atómicas, y cada pregunta se puede responder solo con la observación, sin razonamiento ni conocimiento externo. La taxonomía se derivó de errores reales de los modelos, categorizados en áreas como Relación Visual, Conteo, Atributo, Profundidad y 3D, Localización, Comparación, Reconocimiento de Grano Fino, Integración de Contexto, OCR y Alucinación. Moonshot AI publicó 3,000 preguntas de un conjunto interno de más de 17,000 verificadas. Entre 16 modelos de vanguardia, la precisión general más alta es del 59.7% por GPT-5.6 Sol, seguido de Kimi K3 con 58.5%, Claude Fable 5 con 57.2% y Gemini 3.1 Pro con 56.2%. Los modelos de código abierto quedan significativamente rezagados. La categoría de alucinación es la más débil en promedio: GPT-5.6 Sol obtiene solo un 26.9%, mientras que el más débil Gemini 3.5 Flash logra un 50.6%. Los autores argumentan que muchos errores percibidos como de razonamiento ocurren en realidad a nivel de percepción. Moonshot AI había lanzado previamente WorldVQA y contribuyó a BabyVision, que también mostraron que los modelos de vanguardia fallan en tareas visuales básicas, superando los humanos a ellos. Los investigadores atribuyen esto a un cuello de botella de verbalización.
Fuente: The Decoder (DE) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas