模型智能体 🇺🇸 11.08.2026 16:01

NVIDIA推出Nemotron 3.5 Lightning,助力快速执行专业化智能体任务

NVIDIANVIDIA
NVIDIA为其Nemotron 3模型系列新增了Nemotron 3.5 Lightning——一款开放式的300亿参数混合专家模型,专为常驻运行智能体设计,与同类开放模型相比,token生成速度最高提升4倍,任务完成时间缩短30%。该模型可针对个性化任务进行微调,并可在NVIDIA各类平台上本地运行。此外,NVIDIA还推出了NeMo Switchyard——一个开源路由库,用于优化智能体工作流在准确性、速度和成本方面的表现,据称可将基准测试完成成本降至单独使用Opus 4.8时的约三分之一。
NVIDIA宣布推出Nemotron 3.5 Lightning,这是一款可定制的开源30B混合专家(MoE)模型,专为始终在线的代理设计,扩展了其Nemotron 3系列。该模型与同类开源模型相比,token生成速度提升高达4倍,任务完成时间缩短30%。由于其权重开放,开发者可以针对特定风格、专业领域或编码规范进行微调,从而实现在本地个性化代理AI体验,例如电子邮件管理、智能家居例程或编程助手。NVIDIA与vLLM、Ollama、llama.cpp、LM Studio和Unsloth合作,提供了优化的本地部署选项,包括NVFP4和GGUF格式。该模型可在从NVIDIA RTX PC、DGX Spark到Jetson等本地设备上运行,并可扩展至工作站和数据中心,支持来自宏碁、华硕、戴尔和联想等合作伙伴的Blackwell系统。此外,NVIDIA还推出了NeMo Switchyard,这是一个开源路由库,可根据准确性、速度和成本将代理工作流的每一步引导至最合适的模型,帮助企业管理token成本。内部基准测试显示,NeMo Switchyard将基准完成成本降至Opus 4.8的三分之一左右,同时保持了前沿水平的任务完成率。NeMo Switchyard已在GitHub上提供。
来源: NVIDIA blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻