Allen Institute for AI

来自以下厂商的最新 AI 新闻、模型与发布: Allen Institute for AI. ['MolmoAct2', 'OLMo 2', 'OLMo 2 7B', 'OLMo 3', 'OLMo 3 7B', 'Tülu 3']

模型 🇺🇸

大型语言模型架构对比:从DeepSeek V3到OLMo 2

Sebastian Raschka 发布了一篇详细对比现代开源大型语言模型架构的文章,重点介绍了 DeepSeek V3 中的多头潜在注意力机制(Multi-Head Latent Attention, MLA)和混合专家模型(Mixture-of-Experts, MoE),以及 OLMo 2 中的归一化特性。文章涵盖了从 GPT-2 到 2025 年模型的演进过程。

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
研究 🇺🇸

超越标准大语言模型:线性注意力混合体、文本扩散模型、代码世界模型和小型循环Transformer

文章探讨了标准自回归Transformer大语言模型的替代方案:线性注意力混合体(MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear)、文本扩散模型、代码世界模型和小型循环Transformer。作者注意到MiniMax-M2回归了经典注意力,以及线性注意力在生产中的复杂性。

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
最新新闻