MallitTutkimus 🇷🇺 03.08.2026 23:02

Claude Fable 5 päihittää GPT-5.6:n koodin kirjoittamisessa tyhjästä. Tässä syy

AnthropicAnthropic OpenAIOpenAI
Epoch AI:n MirrorCode-vertailu osoittaa, että Claude Fable 5 ratkaisee 64 prosenttia tehtävistä, kun taas GPT-5.6 Sol selviää vain 20 prosentista. Ero johtuu luotettavuudesta, ei raa'asta kyvykkyydestä: Sol ratkaisee tehtävät usein vain osittain, kun taas Fable suorittaa ne johdonmukaisesti loppuun. Fablen vahva suorituskyky Ada-kielessä, josta on niukasti koulutusdataa, viittaa taitoon eikä ulkoa opittuihin vastauksiin.
Epoch AI päivitti MirrorCode-vertailutaulukkonsa, mikä paljasti, että Anthropicin Claude Fable 5 ratkaisi 64 prosenttia tehtävistä, kun taas OpenAI:n GPT-5.6 Sol selviytyi vain 20 prosentista. Tämä kolminkertainen ero näyttää poikkeavalta, koska mallit suoriutuvat vertailukelpoisesti muissa testeissä, mutta Epoch AI ja Anthropic eivät antaneet virallista selitystä. MirrorCode, joka on kehitetty yhteistyössä METR:n kanssa, vaatii malleja kirjoittamaan kokonaisia ohjelmia alusta alkaen uudelleen, ja ne näkevät vain suoritettavan 'mustan laatikon', dokumentaation ja näkyvät testit; ratkaisujen on läpäistävä kaikki piilotetut testit. Vertailu sisältää 15 oikeaa ohjelmaa, kuten sed ja Ruff, joista jokainen on toteutettu kahdella kielellä, ja yritystä kohden on budjettina 10 miljardia tokenia ja 7 päivää aikaa. Lämpökartan analyysi osoittaa, että Sol ratkaisee tehtävät usein osittain (onnistumisprosentit 50, 33 ja 17), kun taas Fable suorittaa ne lähes aina loppuun (100 ja 83 prosenttia). Toinen vihje: Fablen suorituskyky laskee vain hieman Ada-kielellä (61 prosenttia verrattuna 64 prosenttiin Go-kielellä), kun taas OpenAI-mallit menettävät merkittävästi Ada-kielellä – Sol putoaa 24 prosentista 19 prosenttiin, GPT-5.4 21 prosentista 12 prosenttiin ja GPT-5.5 17 prosentista 5 prosenttiin. Koska näistä ohjelmista ei ole juuri lainkaan Ada-toteutuksia harjoitusdatassa, Fablen suoriutuminen Ada-kielellä osoittaa todellista taitoa eikä muistiin painamista. Epochin oma kontaminaatiotarkistus löysi kuitenkin merkkejä muistiin painamisesta 17 ohjelmassa 25:stä, ja vertailun tarkkojen määrittelyjen asetelma eroaa tosielämän kehitystyöstä.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset