Claude Opus 5: Het Slimste Model Volgens Artificial Analysis – Wat Zit Er Achter de Scores
Anthropic
OpenAI
Anthropic bracht Claude Opus 5 uit op 24 juli 2026 en claimt dat het model de intelligentie van hun topmodel Claude Fable 5 benadert voor de helft van de prijs. Een onafhankelijke benchmarkindex van Artificial Analysis plaatst Opus 5 op de eerste plaats (61 punten), één punt voor op Fable 5 en twee punten voor op GPT-5.6 Sol. Het model staat echter bekend als traag en breedsprakig, met risico op overdenken bij maximale inspanningsinstellingen.
Op 24 juli 2026 onthulde Anthropic Claude Opus 5, gepositioneerd tussen Sonnet 5 en de beperkte Fable/Mythos 5. Het beschikt over een contextvenster van 1 miljoen tokens, 128K output en redeneren dat standaard is ingeschakeld met vijf inspanningsniveaus: laag, gemiddeld, hoog, extra en maximaal. Op interne benchmarks scoort Opus 5 43,3% op Frontier-Bench v0.1 (agentisch coderen) tegenover 18,7% voor Opus 4.8 en 33,7% voor Fable 5; op ARC-AGI-3 (abstract redeneren) behaalt het 30,2% vergeleken met GPT-5.6 Sol's 7,8%. De onafhankelijke Artificial Analysis Intelligence Index geeft Opus 5 echter een score van 61 (maximale inspanning), slechts één punt boven Fable 5 (60) en twee boven GPT-5.6 Sol (59), waarmee het model tot het slimste wordt verklaard, zij het met een kleine marge. Het model wordt omschreven als opvallend traag en breedsprakig: de tijd tot het eerste token bij maximale inspanning bedraagt meer dan een minuut, en het totale tokenverbruik voor de benchmarksuite was ~100M tegen een mediaan van ~63M. Ondanks overwinningen verliest Opus 5 op DeepSWE v1.1 agentisch coderen (68,8% tegenover GPT-5.6 Sol's 72,7%), HealthBench Professional (59,8% tegenover Mythos 5's 66,0%) en de Legal Agent Benchmark (11,7% tegenover Fable 5's 13,3%). Het rapport van Anthropic belicht een geval waarin Opus 5, met een blauwdruk zonder visuele input, zijn eigen computer vision-programma schreef op basis van ruwe pixelgegevens om de taak op te lossen, terwijl concurrenten faalden. Aan de negatieve kant leverde Opus 5 in een eiwitontwerptest met een budget van $10.000 en 24 uur in één run niets op en in een andere slechts 17 niet-gerangschikte varianten, ten prooi vallend aan onproductieve zelfverificatielussen. Het bedrijf waarschuwt dat maximale inspanning kan lijden onder overdenken en beveelt aan om te beginnen met 'extra' voor coderen en 'hoog' voor andere taken.
Bron: Habr — хаб ИИ —
origineel
