Claude Fable 5 scoort beter dan GPT-5.6 bij het herschrijven van code vanaf nul. Zo komt dat
Anthropic
OpenAI
De MirrorCode-benchmark van Epoch AI laat zien dat Claude Fable 5 64 procent van de taken oplost, tegenover 20 procent voor GPT-5.6 Sol. Het verschil zit in betrouwbaarheid, niet in ruwe capaciteit: Sol lost taken vaak gedeeltelijk op, terwijl Fable ze consistent afrondt. Fables sterke prestaties in Ada, een taal met weinig trainingsdata, wijzen op vaardigheid in plaats van memorisatie.
Epoch AI heeft zijn MirrorCode-ranglijst bijgewerkt, waaruit blijkt dat Anthropic's Claude Fable 5 64% van de taken oplost, terwijl OpenAI's GPT-5.6 Sol slechts 20% haalt. Dit drievoudige verschil lijkt afwijkend, aangezien de modellen bij andere tests vergelijkbaar presteren, maar Epoch AI en Anthropic gaven geen officiële verklaring. MirrorCode, ontwikkeld met METR, vereist dat modellen hele programma's vanaf nul herschrijven, waarbij ze alleen een uitvoerbare 'black box', documentatie en zichtbare tests zien; oplossingen moeten alle verborgen tests doorstaan. De benchmark omvat 15 echte programma's zoals sed en Ruff, elk geïmplementeerd in twee talen, met een budget van 10 miljard tokens en 7 dagen per poging. Analyse van de heatmap toont aan dat Sol taken vaak gedeeltelijk oplost (succespercentages van 50%, 33%, 17%), terwijl Fable ze bijna altijd volledig afrondt (100%, 83%). Een andere aanwijzing: Fable's prestaties dalen slechts licht op Ada (61% tegenover 64% op Go), terwijl OpenAI-modellen aanzienlijk verliezen op Ada - Sol zakt van 24% naar 19%, GPT-5.4 van 21% naar 12%, en GPT-5.5 van 17% naar 5%. Aangezien er bijna geen Ada-implementaties van deze programma's in trainingsdata voorkomen, duidt Fable's veerkracht op Ada op echte vaardigheid in plaats van memorisatie. Echter, Epoch's eigen besmettingscontrole vond tekenen van memorisatie in 17 van de 25 programma's, en de exacte-specificatie-instelling van de benchmark verschilt van real-world ontwikkeling.
Bron: Habr — хаб ИИ —
origineel
