⚡ BREAKING
MallitAgentit 🇺🇸 26.07.2026 16:05

Anthropic julkaisee Claude Opus 5:n: Agenttikoodaus ja tietokonetehtävät samaan Opus-hintaan

AnthropicAnthropic
Anthropic on julkaissut Claude Opus 5:n, uuden lippulaivamallin, jossa on parannetut agenttiominaisuudet, muuttumaton hinnoittelu (5/25 dollaria miljoonaa tokenia kohden) ja miljoonan tokenin konteksti-ikkuna. Malli osoittaa merkittäviä parannuksia koodauksessa, kyberturvallisuudessa ja autonomisten tehtävien vertailuarvoissa, ja siinä on päivitetty ajattelumekanismi ja tarkistetut turvallisuuskäytännöt.
Anthropic on julkaissut Claude Opus 5 -mallin, joka korvaa Opus 4.8:n lippulaiva-Opus-tason mallina. Hinnat pysyvät ennallaan: 5 dollaria miljoonalta syötetokenilta ja 25 dollaria miljoonalta tuotostokenilta. Malli yltää älykkyydessä lähelle Claude Fable 5:tä puoleen hintaan, ja se on nyt oletusmalli Claude Maxissa ja tehokkain malli Claude Prossa. API-tasolla on tapahtunut kolme keskeistä muutosta: ajattelu on oletuksena käytössä (effort-parametri ohjaa syvyyttä); ajattelun poistaminen käytöstä (asetus tyyppi: disabled) effort xhigh tai max -asetuksella palauttaa nyt 400-virheen; kehittäjiä kehotetaan poistamaan kehotteet, kuten "ota käyttöön lopullinen tarkistus", koska malli tarkistaa jo itse itsensä. Mallin tunnus on claude-opus-5, konteksti-ikkuna on 1 miljoona tokenia (maksimi ja oletus), maksimituotos on 128 tuhatta tokenia synkronisen Messages API:n kautta ja jopa 300 tuhatta tokenia Message Batches API:n kautta. Vertailutesteissä malli osoitti merkittävää kasvua: FrontierBench v0.1 -testissä 43,3 prosenttia (Opus 4.8 sai 18,7 prosenttia), SWE-bench Verified -testissä 96,0 prosenttia, OSWorld 2.0 -testissä 70,57 prosenttia ja Zapier AutomationBench -testissä 26,0 prosenttia. Agenttipohjaiset tulokset ovat vahvimmat: malli ratkaisi 42 IMO 2026 -tehtävää 42:stä (kultamitali). ARC-AGI-3-testissä korkealla effort-asetuksella tulos oli 30,16 prosenttia (4 kertaa parempi kuin aiempi ennätys). Multimodaalisissa tehtävissä työkalut (säiliöt, kuvan rajaus) ovat merkittävästi tehokkaampia kuin "ajattelu": Chartography-testissä työkalujen kanssa 83,0 prosenttia verrattuna 29,6 prosenttiin. Kyberturvallisuudessa kyvyt kasvoivat sivutuotteena: ExploitBench-testissä malli sai 10,14 lippua ja 99 täydellistä hyväksikäyttöä (Mythos 5 sai 132). Anthropic löysäsi vain lähdekoodin haavoittuvuuksien etsinnän rajoituksia; binäärien skannaus, tunkeutumistestaus ja hyväksikäytön luominen ovat edelleen estettyjä. Luokittelijat laukeavat noin 85 prosenttia harvemmin kuin Fable 5:ssä. UK AISI -testeissä malli ratkaisi "The Last Ones" -tehtävän 8 kertaa 10 yrityksestä. RSP-ohjelman mukaan mallilla on CB-1-kyvyt, mutta ei CB-2-kykyjä. Erinomainen tulos kehotteinjektion kestävyydessä: selainhyökkäykset laskivat 31,5 prosentista 3,70 prosenttiin ilman suojausta ja 0 prosenttiin automaattitilassa. Yhtiö julkaisee kuitenkin myös haittapuolia, kuten hieman korkeamman faktuaalisten hallusinaatioiden määrän verrattuna Opus 4.8:aan.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset