Jenseits der Standard-LLMs: Lineare Aufmerksamkeitshybride, Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer
Der Artikel untersucht Alternativen zu standardmäßigen autoregressiven Transformer-basierten LLMs: lineare Aufmerksamkeitshybride (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-Weltmodelle und kleine rekurrente Transformer. Der Autor stellt eine Rückkehr zur klassischen Aufmerksamkeit in MiniMax-M2 und die Komplexität der linearen Aufmerksamkeit in der Praxis fest.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
