模型硬件与推理 🇩🇪 11.08.2026 18:01

Nvidia开放Nemotron 3.5 Lightning模型,优先速度而非极致智能

NVIDIANVIDIA OpenAIOpenAI MetaMeta Google/DeepMindGoogle/DeepMind
Nvidia发布了Nemotron 3.5 Lightning,这是一款紧凑型开放权重模型,参数量仅为OpenAI gpt-oss-120b的四分之一,但智能水平相当。据称该模型速度极快,在初步测试中,使用最终NVFP4权重时每秒可处理近670个token,为对比模型中最高的。
Nvidia推出了Nemotron 3.5 Lightning,这是其新Nemotron 3.5系列的首款模型。它是Nemotron 3 Nano 30B A3B的直接继任者,并保留了该模型的混合Mamba-Transformer架构:总参数316亿,其中36亿为活跃参数。根据独立基准测试平台Artificial Analysis的数据,该模型的智能指数达到24,比其前代(15)跃升了9个点。这使得Lightning与OpenAI的gpt-oss-120b(24)持平,仅次于Nvidia自家约四倍大的Nemotron 3 Super(26)。同类中最智能的小型模型,如Qwen3.6 35B A3B(32)或Meta的新Muse Glimmer(35),仍然明显领先。Nvidia将Lightning定位于效率前沿的另一侧:在使用最终NVFP4权重的初步测试中,该模型达到了每秒近670个token的速度,这是所比较模型中测得的最高值,几乎是Google Gemini 3.5 Flash-Lite(每秒386个token)的两倍。智能指数中的一项任务因此耗时约0.5分钟,而Qwen3.6 35B A3B耗时约3.5分钟,Gemma 4 31B则约5.8分钟。专有模型继续主导整体效率前沿:Gemini 3.5 Flash-Lite在类似的任务耗时下实现了37的智能指数,GPT-5.6 Luna(最大)在不到两分钟内达到了52点。根据Artificial Analysis,最大的改进体现在代理能力方面。在GDPval-AA v2中,Lightning达到了824的Elo评分,比Nemotron 3 Nano高出334分,超越了gpt-oss-120b(800)和更大的Nemotron 3 Super(698)。在Terminal-Bench v2.1中,得分从7%升至24.3%,几乎达到了gpt-oss-120b(26.2%)的水平。凭借宽松的OpenMDW-1.1许可证,Nvidia将这款模型定位为高吞吐量代理流水线的高效主力。根据Artificial Analysis,Nvidia与CodeRabbit和Harvey等合作伙伴在后训练方面进行了合作,以提高特定领域的性能。Nvidia提供BF16和NVFP4权重版本;NVFP4变体在智能指数上也获得24分,与更高精度版本相比性能损失极小。该推理模型仅处理文本,上下文窗口为100万token。权重即刻可用;DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius和Crusoe提供无服务器推理服务。
来源: The Decoder (DE) — 原文
我们之前关于此话题的帖子 ↓
最新新闻