Voorbij standaard LLM's: lineaire aandacht hybriden, tekst diffusie, code wereldmodellen en kleine recursieve transformatoren
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
Het artikel van Sebastian Raschka verkent alternatieven voor standaard autoregressieve transformer LLM's, waaronder lineaire aandacht hybriden (bijvoorbeeld MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), tekst diffusiemodellen, code wereldmodellen en kleine recursieve transformatoren. Het bespreekt de heropleving van lineaire aandachtmechanismen en uitdagingen, zoals MiniMax die terugkeert naar standaard aandacht in het M2-model vanwege slechte prestaties bij redeneertaken.
Sebastian Raschka bespreekt alternatieven voor standaard autoregressieve decoder-stijl transformatoren, die zijn gebaseerd op multi-head attention. Opvallende modellen zijn MiniMax-M1 met lightning attention, Qwen3-Next met Gated DeltaNet en Gated Attention, DeepSeek V3.2 met sparse attention, en Kimi Linear. MiniMax keerde echter terug naar normale attention in het M2-model, vanwege slechte nauwkeurigheid bij redeneer- en multi-turn taken. Qwen3-Next en Kimi Linear gebruiken een verhouding van 3:1 van lineaire attention (Gated DeltaNet) tot volledige attention (Gated Attention). Gated DeltaNet combineert Mamba2 met een delta-regel voor recurrente statusupdates. Het artikel noemt ook andere alternatieven zoals tekst-diffusiemodellen, code world-modellen en kleine recursieve transformatoren, maar gaat daar niet verder op in.
Bron: Sebastian Raschka —
origineel
