ИсследованияМодели 🇺🇸 27.07.2026 17:04

За пределами стандартных LLM: гибриды линейного внимания, текстовая диффузия, кодовые мировые модели и маленькие рекурсивные трансформеры

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
В статье Себастьяна Рашки рассматриваются альтернативы стандартным авторегрессионным трансформерным LLM, включая гибриды линейного внимания (например, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), модели текстовой диффузии, кодовые мировые модели и маленькие рекурсивные трансформеры. Обсуждается возрождение механизмов линейного внимания и их проблемы, такие как возврат MiniMax к стандартному вниманию в модели M2 из-за низкой производительности на задачах рассуждения.
Себастьян Рашка обсуждает альтернативы стандартным авторегрессивным трансформерам декодерного типа, основанным на многоголовочном внимании (multi-head attention). К заметным моделям относятся MiniMax-M1 с lightning attention, Qwen3-Next с Gated DeltaNet и Gated Attention, DeepSeek V3.2 с разреженным вниманием (sparse attention) и Kimi Linear. Однако компания MiniMax вернулась к обычному вниманию
Показать ещё ↓
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости