Pieni tekoälymalli 11 kertaa halvempi kuin GPT-5.6 Luna ja lähes yhtä hyvä logiikkatestissä
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab julkaisi testitulokset päättelymallistaan BDH-CQ, jossa on 150 miljoonaa parametria ja joka sai 29,5 prosenttia ARC-AGI-1-vertailussa. Sen laskentakustannus oli 0,0007 dollaria tehtävää kohti, 11 kertaa halvempi kuin OpenAI:n GPT-5.6 Luna, joka sai 34,2 prosenttia 0,008 dollarin kustannuksella tehtävää kohti. Lab väittää, että vaihtoehtoiset arkkitehtuurit voivat parantaa kustannustehokkuutta huomattavasti.
Pathway Lab, joka keskittyy transformereista poikkeaviin arkkitehtuureihin, julkaisi tulokset päättelymallistaan BDH-CQ. Vain 150 miljoonan parametrin mallilla saavutettiin 29,5 prosentin tulos ARC-AGI-1-vertailussa, ja kustannus oli vain 0,0007 dollaria tehtävää kohti. Tämä tekee siitä 11 kertaa halvemman kuin OpenAI:n pieni malli GPT-5.6 Luna, joka sai 34,2 prosenttia ja maksoi 0,008 dollaria tehtävältä jopa 80 prosentin hinnanalennuksen jälkeen. Vertailun vuoksi Anthropicin Claude Opus 5 ja Googlen Gemini 3.1 Pro saivat 97–98 prosenttia samassa testissä, mutta maksoivat 0,5–0,6 dollaria tehtävältä, eli lähes tuhat kertaa enemmän. Alibaban Qwen3 235B maksoi yli kolme kertaa enemmän kuin BDH-CQ, mutta suoriutui huonommin. Labin mukaan ero johtuu päättelymekanismeista: useimmat nykyiset tekoälymallit tuottavat välimuotoista tekstiä, joka kuluttaa tokeneita, kun taas BDH-CQ ratkaisee ongelmat hiljaa muistissaan. Alustavat kokeet osoittivat, että BDH-CQ noudattaa tavallisia skaalauslakeja, jotka ovat verrattavissa transformereihin, joiden parametrimäärä on yhdestä 600 miljardiin. Pathway suunnittelee tarttuvansa vaikeampiin tehtäviin, mukaan lukien matemaattinen päättely, ARC-AGI-2-testi ja lopulta koko ARC-AGI-3-arviointi, toivoen tehokkuusedun säilyvän suuremmissa ja monimutkaisemmissa ongelmissa.
Lähde: 3DNews —
Alkuperäinen
