LLM:t vuonna 2025: Edistys, haasteet ja ennusteet
DeepSeek
OpenAI
Alibaba/Qwen
Moonshot AI
NVIDIA
Google/DeepMind
Vuonna 2025 LLM-kehitystä hallitsivat päättelymallit, jotka käyttävät vahvistusoppimista todennettavissa olevilla palkkioilla (RLVR) ja GRPO-algoritmia, jonka DeepSeek R1 käynnisti. Keskeisiä trendejä ovat laskennan skaalaaminen päättelyvaiheessa, MoE-arkkitehtuurit ja tehokkuusparannukset, kuten Gated DeltaNets. Akateeminen tutkimus korosti GRPO-muunnelmia, joissa on parannuksia, kuten nollagradienttien suodatus ja token-tason häviö.
Kun vuosi 2025 päättyy, sitä hallitsivat RLVR- ja GRPO-päättelymallit DeepSeek R1:n tammikuisen julkaisun jälkeen. DeepSeek R1 osoitti, että päättelykäyttäytymistä voidaan kehittää vahvistusoppimisella, ja sen avoimen painon malli suoriutui vertailukelpoisesti omien mallien kanssa. Artikkeli sytytti myös keskustelun koulutuskustannuksista, joiden arviot olivat noin viisi miljoonaa dollaria lopullisesta ajosta, mutta tutkijoiden palkat eivät sisälly tähän. RLVR käyttää todennettavia palkkioita (esimerkiksi matematiikka, koodi) jälkikoulutukseen, vähentäen riippuvuutta kalliista ihmismerkinnöistä. Jokainen suuri kielimallikehittäjä julkaisi päättelyvariantin. Muita painopisteitä: vuoden 2022 RLHF+PPO, vuoden 2023 LoRA SFT, vuoden 2024 keskivaihe koulutus. Ennusteita vuosille 2026-2027 ovat RLVR-laajennukset, päättelyajan skaalaus ja jatkuva oppiminen. GRPO:sta tuli tutkimuksen suosikki, ja siihen lisättiin monia matemaattisia parannuksia, kuten nollagradienttisuodatus, aktiivinen näytteenotto, token-tason menetys ja ei-KL-menetystä, jotka parantavat merkittävästi koulutuksen vakautta. Arkkitehtuurisesti huippumallit käyttävät edelleen dekooderityylisiä transformereita MoE-kerroksilla ja tehokkuutta parannetulla huomiolla (ryhmitelty kysely, liukuva ikkuna, monipäinen latentti huomio). Uudempiin tehokkuusparannuksiin kuuluvat Gated DeltaNets Qwen3-Nextissä ja Kimi Linearissa sekä Mamba-2-kerrokset NVIDIA:n Nemotron 3:ssa.
Lähde: Sebastian Raschka —
Alkuperäinen
