Vakio-LLM:ien tuolla puolen: lineaarisen attention hybridit, tekstidiffuusiomallit, koodimaailmamallit ja pienet rekurrentit transformerit
Artikkelissa tarkastellaan vaihtoehtoja tavallisille autoregressiivisille transformer-pohjaisille kielimalleille: lineaarisen attention hybridit (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), tekstidiffuusiomallit, koodimaailmamallit ja pienet rekurrentit transformerit. Kirjoittaja huomauttaa paluusta klassiseen attentioniin MiniMax-M2:ssa ja lineaarisen attentionin monimutkaisuudesta tuotannossa.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA

