За пределами стандартных LLM: гибриды линейного внимания, текстовая диффузия, кодовые мировые модели и маленькие рекурсивные трансформеры
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
В статье Себастьяна Рашки рассматриваются альтернативы стандартным авторегрессионным трансформерным LLM, включая гибриды линейного внимания (например, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), модели текстовой диффузии, кодовые мировые модели и маленькие рекурсивные трансформеры. Обсуждается возрождение механизмов линейного внимания и их проблемы, такие как возврат MiniMax к стандартному вниманию в модели M2 из-за низкой производительности на задачах рассуждения.
Себастьян Рашка обсуждает альтернативы стандартным авторегрессивным трансформерам декодерного типа, основанным на многоголовочном внимании (multi-head attention). К заметным моделям относятся MiniMax-M1 с lightning attention, Qwen3-Next с Gated DeltaNet и Gated Attention, DeepSeek V3.2 с разреженным вниманием (sparse attention) и Kimi Linear. Однако компания MiniMax вернулась к обычному вниманию
Показать ещё ↓
Источник: Sebastian Raschka —
оригинал
