Claude Opus 5: el modelo más inteligente según Artificial Analysis – qué hay detrás de las puntuaciones
Anthropic
OpenAI
Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, afirmando que se acerca a la inteligencia de su modelo tope Claude Fable 5 a la mitad del precio. El índice de referencia independiente de Artificial Analysis sitúa a Opus 5 en primer lugar (61 puntos), un punto por delante de Fable 5 y dos por delante de GPT-5.6 Sol. Sin embargo, se señala que el modelo es lento y verboso, con riesgo de pensar demasiado en configuraciones de máximo esfuerzo.
Anthropic presentó Claude Opus 5 el 24 de julio de 2026, situado entre Sonnet 5 y la limitada Fable/Mythos 5. Cuenta con una ventana de contexto de 1 millón de tokens, 128 000 tokens de salida y razonamiento activado por defecto con cinco niveles de esfuerzo: bajo, medio, alto, extra y máximo. En evaluaciones internas, Opus 5 obtiene un 43,3 % en Frontier-Bench v0.1 (codificación agéntica) frente al 18,7 % de Opus 4.8 y el 33,7 % de Fable 5; en ARC-AGI-3 (razonamiento abstracto) alcanza un 30,2 %, comparado con el 7,8 % de GPT-5.6 Sol. Sin embargo, el índice independiente Artificial Analysis Intelligence otorga a Opus 5 una puntuación de 61 (esfuerzo máximo), solo un punto por encima de Fable 5 (60) y dos por encima de GPT-5.6 Sol (59), declarándolo el modelo más inteligente por un margen estrecho. Se describe que el modelo es notablemente lento y verboso: el tiempo hasta el primer token con esfuerzo máximo supera el minuto, y el consumo total de tokens para la suite de evaluación fue de aproximadamente 100 millones frente a una mediana de 63 millones. A pesar de los logros, Opus 5 pierde en codificación agéntica DeepSWE v1.1 (68,8 % frente al 72,7 % de GPT-5.6 Sol), HealthBench Professional (59,8 % frente al 66,0 % de Mythos 5) y Legal Agent Benchmark (11,7 % frente al 13,3 % de Fable 5). El informe de Anthropic destaca un caso en el que Opus 5, al recibir un plano sin visión, escribió su propio programa de visión por computadora a partir de datos de píxeles en bruto para resolver la tarea, mientras que los competidores fallaron. En el lado negativo, en una prueba de diseño de proteínas con un presupuesto de 10 000 dólares y 24 horas, Opus 5 no entregó nada en una ejecución y solo 17 variantes no clasificadas en otra, siendo víctima de bucles improductivos de autoverificación. La empresa advierte que el esfuerzo máximo puede sufrir de sobreanálisis y recomienda comenzar con extra para codificación y alto para otras tareas.
Fuente: Habr — хаб ИИ —
original
