Voorbij standaard LLM's: lineaire aandacht hybriden, tekst diffusiemodellen, code wereldmodellen en kleine recurrente transformatoren
Het artikel onderzoekt alternatieven voor standaard autoregressieve transformer-gebaseerde LLM's: lineaire aandacht hybriden (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), tekst diffusiemodellen, code wereldmodellen en kleine recurrente transformatoren. De auteur merkt een terugkeer naar klassieke aandacht op in MiniMax-M2 en de complexiteit van lineaire aandacht in productie.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
