ModelosInvestigación 🇷🇺 03.08.2026 23:02

Claude Fable 5 Supera a GPT-5.6 en la Reescritura de Código desde Cero. He Aquí el Motivo

AnthropicAnthropic OpenAIOpenAI
El punto de referencia MirrorCode de Epoch AI muestra que Claude Fable 5 resuelve el 64% de las tareas, frente al 20% de GPT-5.6 Sol. La brecha se debe a la fiabilidad, no a la capacidad bruta: Sol a menudo resuelve tareas parcialmente, mientras que Fable las completa de manera consistente. El sólido rendimiento de Fable en Ada, un lenguaje con escasos datos de entrenamiento, sugiere habilidad más que memorización.
Epoch AI actualizó su clasificación MirrorCode, revelando que el Claude Fable 5 de Anthropic resolvió el 64% de las tareas, mientras que el GPT-5.6 Sol de OpenAI solo logró el 20%. Esta diferencia triple parece anómala dado que los modelos se desempeñan de manera comparable en otras pruebas, pero Epoch AI y Anthropic no ofrecieron una explicación oficial. MirrorCode, desarrollado con METR, requiere que los modelos reescriban programas enteros desde cero, viendo solo una 'caja negra' ejecutable, documentación y pruebas visibles; las soluciones deben pasar todas las pruebas ocultas. El benchmark incluye 15 programas reales como sed y Ruff, cada uno implementado en dos lenguajes, con un presupuesto de 10 mil millones de tokens y 7 días por intento. El análisis del mapa de calor muestra que Sol a menudo resuelve parcialmente las tareas (50%, 33%, 17% de tasas de éxito), mientras que Fable casi siempre las completa (100%, 83%). Otra pista: el rendimiento de Fable solo disminuye ligeramente en Ada (61% frente al 64% en Go), mientras que los modelos de OpenAI pierden significativamente en Ada — Sol cae del 24% al 19%, GPT-5.4 del 21% al 12%, y GPT-5.5 del 17% al 5%. Dado que casi no existen implementaciones de estos programas en Ada en los datos de entrenamiento, la resistencia de Fable en Ada indica habilidad genuina en lugar de memorización. Sin embargo, la propia verificación de contaminación de Epoch encontró signos de memorización en 17 de 25 programas, y el entorno de especificación exacta del benchmark difiere del desarrollo en el mundo real.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas