⚡ BREAKING
GPT-2:sta gpt-oss:iin: Arkkitehtuuristen edistysaskeleiden analyysi ja vertailu Qwen3:n kanssa
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI julkaisi gpt-oss-120b ja gpt-oss-20b, ensimmäiset avoimen painon mallinsa sitten GPT-2:n. Arkkitehtuuri hyödyntää Mixture-of-Experts-tekniikkaa, Grouped Query Attention -menetelmää, RoPE:a, SwiGLU:a ja MXFP4-optimointia paikallista päättelyä varten. Vertailu GPT-2:n ja Qwen3:n kanssa korostaa edistysaskelia leveyden ja syvyyden välisissä kompromisseissa sekä attention sink -ilmiössä.
OpenAI julkaisi gpt-oss-120b- ja gpt-oss-20b-mallit, jotka ovat sen ensimmäiset avoimen painon suuret kielimallit (LLM) sitten GPT-2:n vuonna 2019. Mallit sisältävät useita arkkitehtonisia parannuksia GPT-2:een verrattuna: dropout on poistettu, absoluuttiset sijaintiupotukset on korvattu RoPE:llä, aktivointifunktio on vaihdettu GELU:sta SwiGLU:hun, on lisätty asiantuntijasekoitus (MoE, mixture-of-experts) ja ryhmitelty kyselyhuomio (GQA, grouped query attention). MoE lisää kokonaisparametrien määrää, mutta aktivoi vain osajoukon kutakin tokenia kohden, mikä pitää päättelyn tehokkaana. GQA vähentää avain-arvo-päitä muistinkulutuksen pienentämiseksi. Mallit käyttävät MXFP4-optimointia, jotta ne mahtuvat yhdelle GPU:lle (20B mahtuu 16 gigatavun kuluttaja-GPU:lle, 120B H100 80 gigatavun GPU:lle). Verrattuna Qwen3-malliin gpt-oss tutkii leveyden ja syvyyden välisiä kompromisseja. Myös huomiopainotukset ja upotukset (attention bias ja sinks) käsitellään. Artikkelissa mainitaan lyhyesti myös GPT-5 asiayhteydessä. Vertailuarvot osoittavat kilpailukykyistä suorituskykyä, vaikka yksityiskohtaisia pisteitä ei annetakaan.
Lähde: Sebastian Raschka —
Alkuperäinen
