⚡ BREAKING
Anthropic onthult Claude Opus 5: agentisch coderen en computertaken tegen dezelfde Opus-prijs
Anthropic
Anthropic heeft Claude Opus 5 uitgebracht, een nieuw vlaggenschipmodel met verbeterde agentische mogelijkheden, ongewijzigde prijzen ($5/$25 per miljoen tokens) en een contextvenster van 1 miljoen tokens. Het model laat aanzienlijke verbeteringen zien op het gebied van programmeren, cybersecurity en autonome taken, met een bijgewerkt denkmechanisme en herziene veiligheidsrichtlijnen.
Anthropic heeft Claude Opus 5 uitgebracht, die Opus 4.8 vervangt als het vlaggenschipmodel van het Opus-niveau. De prijzen blijven hetzelfde: $5 per miljoen invoertokens en $25 per miljoen uitvoertokens. Het model benadert Claude Fable 5 in intelligentie tegen de helft van de prijs en is nu het standaardmodel op Claude Max en het krachtigste op Claude Pro. Op API-niveau zijn er drie belangrijke wijzigingen doorgevoerd: denken is standaard ingeschakeld (de effort-parameter regelt de diepte); het uitschakelen van denken (instelling type: disabled) met effort xhigh of max levert nu een 400-fout op; ontwikkelaars wordt geadviseerd prompts zoals "enable final check" te verwijderen, omdat het model al zelf controleert. Het model-ID is claude-opus-5, de contextvenster is 1M tokens (maximaal en standaard), de maximale uitvoer is 128k tokens via de synchrone Messages API en tot 300k via de Message Batches API. In benchmarks liet het model aanzienlijke groei zien: op FrontierBench v0.1 — 43,3% (Opus 4.8 — 18,7%), op SWE-bench Verified — 96,0%, OSWorld 2.0 — 70,57%, Zapier AutomationBench — 26,0%. Agentische resultaten zijn het sterkst: het model loste 42 van de 42 IMO 2026-problemen op (gouden medaille). Op ARC-AGI-3 met hoge effort — 30,16% (4 keer beter dan het vorige record). Bij multimodale taken zijn tools (containers, beeldcrop) aanzienlijk effectiever dan "denken": op Chartography met tools — 83,0% versus 29,6%. In cybersecurity zijn de mogelijkheden als neveneffect toegenomen: op ExploitBench behaalde het model 10,14 vlaggen en 99 volledige exploits (Mythos 5 — 132). Anthropic heeft alleen de beperkingen op het zoeken naar kwetsbaarheden in broncode versoepeld; binaire scanning, penetratietesten en het genereren van exploits blijven geblokkeerd. Classifiers zullen ongeveer 85% minder vaak activeren dan bij Fable 5. Op UK AISI-tests loste het model de taak "The Last Ones" op in 8 van de 10 pogingen. Volgens het RSP-programma heeft het model CB-1-mogelijkheden, maar niet CB-2. Uitstekend resultaat bij prompt-injectieweerstand: browseraanvallen daalden van 31,5% naar 3,70% zonder bescherming en naar 0% met automatische modus. Het bedrijf publiceert echter ook nadelen, waaronder een iets hoger aantal feitelijke hallucinaties vergeleken met Opus 4.8.
Bron: MarkTechPost —
origineel
