MallitTekoälyturvallisuus 🇷🇺 29.07.2026 19:03

Claude Opus 5: Älykkäin malli Artificial Analysisin mukaan – mitä pisteiden takana on

AnthropicAnthropic OpenAIOpenAI
Anthropic julkaisi Claude Opus 5:n 24. heinäkuuta 2026 väittäen sen lähestyvän huippumallinsa Claude Fable 5:n älykkyyttä puoleen hintaan. Artificial Analysisin riippumaton vertailuindeksi asettaa Opus 5:n ensimmäiselle sijalle (61 pistettä), pisteen edelle Fable 5:tä ja kaksi pistettä edelle GPT-5.6 Solia. Malli on kuitenkin todettu hitaaksi ja monisanaiseksi, ja se saattaa ajatella liikaa maksimiasetuksilla.
Anthropic julkisti Claude Opus 5:n 24. heinäkuuta 2026. Se sijoittuu Sonnet 5:n ja rajoitetun Fable/Mythos 5:n väliin. Mallissa on 1 miljoonan tokenin konteksti-ikkuna, 128 000 tokenin ulostulo, ja päättely on oletuksena käytössä viidellä vaatimustasolla: matala, keskitaso, korkea, erittäin korkea ja maksimi. Sisäisissä vertailuissa Opus 5 saa 43,3 % Frontier-Bench v0.1:ssä (agenttiohjelmointi), kun Opus 4.8 saa 18,7 % ja Fable 5 33,7 %; ARC-AGI-3:ssa (abstrakti päättely) se saavuttaa 30,2 %, kun GPT-5.6 Sol saa 7,8 %. Riippumaton Artificial Analysis Intelligence Index antaa Opus 5:lle kuitenkin pisteet 61 (maksimivaivalla), vain yhden pisteen enemmän kuin Fable 5:lle (60) ja kaksi enemmän kuin GPT-5.6 Solille (59), julistaen sen kapealla marginaalilla älykkäimmäksi malliksi. Malli on huomattavan hidas ja monisanainen: aika ensimmäiseen tokeniin maksimivaivalla ylittää minuutin, ja koko vertailupatterin token-kulutus oli noin 100 miljoonaa verrattuna mediaaniin 63 miljoonaa. Voitoista huolimatta Opus 5 häviää DeepSWE v1.1 -agenttiohjelmoinnissa (68,8 % vs. GPT-5.6 Solin 72,7 %), HealthBench Professionalissa (59,8 % vs. Mythos 5:n 66,0 %) ja Legal Agent Benchmarkissa (11,7 % vs. Fable 5:n 13,3 %). Anthropicin raportti korostaa tapausta, jossa Opus 5, saatuaan suunnitelman ilman visuaalista dataa, kirjoitti oman tietokonenäköohjelmansa raakapikselidatasta ratkaistakseen tehtävän, kun kilpailijat epäonnistuivat. Negatiivisena puolena proteiinisuunnittelutestissä, jossa budjetti oli 10 000 dollaria ja aikaa 24 tuntia, Opus 5 ei tuottanut mitään yhdellä ajolla ja vain 17 rankkaamatonta varianttia toisella, jääden hedelmättömien itsearviointisilmukoiden uhriksi. Yritys varoittaa, että maksimivaiva saattaa kärsiä liika-ajattelusta, ja suosittelee aloittamaan erittäin korkeasta vaatimustasosta ohjelmointiin ja korkeasta muihin tehtäviin.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset