ModelosPesquisa 🇷🇺 03.08.2026 23:02

Claude Fable 5 supera GPT-5.6 em reescrita de código do zero. Veja por quê

AnthropicAnthropic OpenAIOpenAI
O benchmark MirrorCode da Epoch AI mostra o Claude Fable 5 resolvendo 64% das tarefas, contra 20% do GPT-5.6 Sol. A diferença vem da confiabilidade, não da capacidade bruta: Sol frequentemente resolve tarefas parcialmente, enquanto Fable as conclui consistentemente. O forte desempenho de Fable em Ada, uma linguagem com dados de treinamento escassos, sugere habilidade, não memorização.
A Epoch AI atualizou seu ranking MirrorCode, revelando que o Claude Fable 5, da Anthropic, resolveu 64% das tarefas, enquanto o GPT-5.6 Sol, da OpenAI, conseguiu apenas 20%. Essa diferença de três vezes parece anômala, dado que os modelos têm desempenho comparável em outros testes, mas a Epoch AI e a Anthropic não ofereceram explicação oficial. O MirrorCode, desenvolvido em parceria com a METR, exige que os modelos reescrevam programas inteiros do zero, vendo apenas uma 'caixa-preta' executável, documentação e testes visíveis; as soluções devem passar em todos os testes ocultos. O benchmark inclui 15 programas reais, como sed e Ruff, cada um implementado em duas linguagens, com um orçamento de 10 bilhões de tokens e 7 dias por tentativa. A análise do mapa de calor mostra que o Sol frequentemente resolve tarefas parcialmente (taxas de sucesso de 50%, 33%, 17%), enquanto o Fable quase sempre as completa (100%, 83%). Outra pista: o desempenho do Fable cai apenas ligeiramente em Ada (61% vs. 64% em Go), enquanto os modelos da OpenAI perdem significativamente em Ada — o Sol cai de 24% para 19%, o GPT-5.4 de 21% para 12%, e o GPT-5.5 de 17% para 5%. Como quase não existem implementações desses programas em Ada nos dados de treinamento, a resiliência do Fable em Ada indica habilidade genuína, em vez de memorização. No entanto, a própria verificação de contaminação da Epoch encontrou sinais de memorização em 17 dos 25 programas, e a configuração de especificação exata do benchmark difere do desenvolvimento no mundo real.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas