TutkimusMallit 🇺🇸 27.07.2026 17:04

Tavanomaisten kielimallien ulkopuolella: Lineaarisen huomion hybridit, tekstidiffuusio, koodimaailman mallit ja pienet rekursiiviset transformeerit

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschkan artikkeli tutkii vaihtoehtoja tavallisille autoregressiivisille transformeerikielimalleille, mukaan lukien lineaarisen huomion hybridit (esimerkiksi MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), tekstidiffuusiomallit, koodimaailman mallit ja pienet rekursiiviset transformeerit. Siinä käsitellään lineaaristen huomiointimekanismien elpymistä ja haasteita, kuten MiniMaxin palaamista tavalliseen huomiointiin M2-mallissaan heikon päättelytehokkuuden vuoksi.
Sebastian Raschka keskustelee vaihtoehdoista tavallisille autoregressiivisille dekoderityyppisille transformereille, jotka perustuvat monipäähuomioon (multi-head attention). Merkittäviä malleja ovat MiniMax-M1, jossa on salamanhuomio (lightning attention), Qwen3-Next, joka käyttää Gated DeltaNet- ja Gated Attention -mekanismeja, DeepSeek V3.2 harvahuomiolla (sparse attention) sekä Kimi Linear. MiniMax kuitenkin palasi tavalliseen huomioon M2-mallissaan vedoten heikkoon tarkkuuteen päättely- ja monivuorotehtävissä. Qwen3-Next ja Kimi Linear käyttävät lineaarisen huomion (Gated DeltaNet) ja täyden huomion (Gated Attention) suhdetta 3:1. Gated DeltaNet yhdistää Mamba2:n ja delta-säännön toistuvien tilojen päivityksiin. Artikkelissa mainitaan myös muita vaihtoehtoja, kuten tekstidiffuusiomallit, koodimaailmamallit ja pienet rekursiiviset transformerit, mutta niitä ei käsitellä tarkemmin.
Lähde: Sebastian Raschka — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset