MiniMax

来自以下厂商的最新 AI 新闻、模型与发布: MiniMax. ['Abigail', 'Hailuo Minimax', 'M2.1', 'M2.5', 'MiniMax', 'MiniMax-M1', 'MiniMax-M2', 'MiniMax M2.1', 'MiniMax M2.5', 'MiniMax M2.7', 'MiniMax-M2.7', 'MiniMax M3', 'MiniMax-W']

研究 🇺🇸

超越标准大语言模型:线性注意力混合体、文本扩散模型、代码世界模型和小型循环Transformer

文章探讨了标准自回归Transformer大语言模型的替代方案:线性注意力混合体(MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear)、文本扩散模型、代码世界模型和小型循环Transformer。作者注意到MiniMax-M2回归了经典注意力,以及线性注意力在生产中的复杂性。

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
研究 🇺🇸

2026年上半年LLM研究论文综述

Sebastian Raschka发布了一份2026年1月至5月间关于大型语言模型(LLM)的关键科学论文精选列表。该选择突显了以下趋势:混合架构(交替使用注意力机制和状态空间层)、高效推理、智能体系统以及扩散语言模型。特别关注了Nvidia采用混合设计的Nemotron 3和采用Gated DeltaNet的Qwen3.6。

NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral BaiduBaidu CohereCohere Technology Innovation InstituteTechnology Innovation Institute MiniMaxMiniMax
Sebastian Raschka27.07 · 12:03
最新新闻