OnderzoekModellen 🇺🇸 27.07.2026 17:04

Voorbij standaard LLM's: lineaire aandacht hybriden, tekst diffusiemodellen, code wereldmodellen en kleine recurrente transformatoren

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Het artikel onderzoekt alternatieven voor standaard autoregressieve transformer-gebaseerde LLM's: lineaire aandacht hybriden (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), tekst diffusiemodellen, code wereldmodellen en kleine recurrente transformatoren. De auteur merkt een terugkeer naar klassieke aandacht op in MiniMax-M2 en de complexiteit van lineaire aandacht in productie.
De auteur, Sebastian Raschka, analyseert alternatieven voor standaard autoregressieve LLM's (large language models) op basis van transformers met een aandachtsmechanisme (attention). Onder de besproken benaderingen bevinden zich lineaire aandacht-hybrides, die de laatste tijd een opleving beleven. Hiertoe behoren MiniMax-M1 (456B parameters, MoE, Mixture of Experts, met lightning attention), Qwen3-Next (dat Gated DeltaNet en Gated Attention combineert in een verhouding van 3:1), DeepSeek V3.2 (schaarse aandacht, sublineaire complexiteit) en Kimi Linear (ook met Gated DeltaNet). MiniMax-M2 keerde echter terug naar standaardaandacht vanwege nauwkeurigheidsproblemen bij redeneertaken en multitasking. Verder worden tekstdiffusiemodellen genoemd, code-gebaseerde wereldmodellen (bijvoorbeeld voor het genereren van de spelstatus) en kleine recurrente transformers, zoals een 1,5B-model dat op syntactische analyse wordt vergeleken met GPT-4.
Bron: Sebastian Raschka — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws