Tavanomaisten kielimallien ulkopuolella: Lineaarisen huomion hybridit, tekstidiffuusio, koodimaailman mallit ja pienet rekursiiviset transformeerit
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
Sebastian Raschkan artikkeli tutkii vaihtoehtoja tavallisille autoregressiivisille transformeerikielimalleille, mukaan lukien lineaarisen huomion hybridit (esimerkiksi MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), tekstidiffuusiomallit, koodimaailman mallit ja pienet rekursiiviset transformeerit. Siinä käsitellään lineaaristen huomiointimekanismien elpymistä ja haasteita, kuten MiniMaxin palaamista tavalliseen huomiointiin M2-mallissaan heikon päättelytehokkuuden vuoksi.
Sebastian Raschka keskustelee vaihtoehdoista tavallisille autoregressiivisille dekoderityyppisille transformereille, jotka perustuvat monipäähuomioon (multi-head attention). Merkittäviä malleja ovat MiniMax-M1, jossa on salamanhuomio (lightning attention), Qwen3-Next, joka käyttää Gated DeltaNet- ja Gated Attention -mekanismeja, DeepSeek V3.2 harvahuomiolla (sparse attention) sekä Kimi Linear. MiniMax kuitenkin palasi tavalliseen huomioon M2-mallissaan vedoten heikkoon tarkkuuteen päättely- ja monivuorotehtävissä. Qwen3-Next ja Kimi Linear käyttävät lineaarisen huomion (Gated DeltaNet) ja täyden huomion (Gated Attention) suhdetta 3:1. Gated DeltaNet yhdistää Mamba2:n ja delta-säännön toistuvien tilojen päivityksiin. Artikkelissa mainitaan myös muita vaihtoehtoja, kuten tekstidiffuusiomallit, koodimaailmamallit ja pienet rekursiiviset transformerit, mutta niitä ei käsitellä tarkemmin.
Lähde: Sebastian Raschka —
Alkuperäinen
