モデルオープンソース 🇨🇳 27.07.2026 06:02

Ant Bailing Releases New Hybrid Reasoning Model Ling-3.0-Flash

Ant Bailing (a Chinese company) has introduced a new model, Ling-3.0-Flash, with 124 billion total parameters and 5.1 billion active parameters. The model is already available on OpenRouter, free for one week, and will then be open-sourced. It achieves results comparable to models two to three times larger, thanks to a new hybrid attention architecture.
7月24日,蚂蚁百灵正式发布了新一代原生混合推理模型Ling-3.0-Flash。模型总参数量为124B,每次计算激活5.1B参数。在显著缩减模型规模并降低计算成本的同时,该模型在基础推理、指令遵循、长文本处理等关键指标上,达到或超越了参数规模大2-3倍的行业领先模型,展现出更高的“智能效率比”和实用性。据悉,该模型已在OpenRouter上线,提供一周免费使用,之后将完全开源。该版本特别针对智能体应用场景进行了深度优化。模型通过超过10,000次真实交互扩展了训练环境,并优化了复杂任务的自我纠正和长期规划机制。在编写代码、复杂任务分解、多源信息深度分析等场景中,模型展现出更强的自主完成任务的能力,解决了传统模型在大任务中容易“偏离”或中断的问题。实现“小体积、高智能”的关键在于重新设计了基础计算架构。Ling-3.0-Flash放弃了简单的参数堆叠,在预训练阶段采用了混合注意力架构,以5:1的比例交替使用KDA线性注意力和MLA。此外,模型将上一代的Lightning Attention升级为KDA(Kimi Delta Attention),在Delta Rules的状态更新中引入了细粒度对角门控,从而在处理长文档和代码库时更精确地记住关键信息。同时,模型进一步将每个token的专家激活比例从1/32压缩到1/64,实现了更高的“效率杠杆”。为了让AI智能体运行得更快、更稳定,蚂蚁百灵还提供了相应的工程和协作架构。在响应速度方面,通过引入分层集群缓存,避免了长对话和多轮交互中的重复计算,使长输入的第一个token延迟降低了60-80%。在任务稳定性方面,升级后的多智能体交互架构允许多个智能体协同工作并相互验证,有效降低了单一模型出错的风险。
出典: QbitAI 量子位 — 原文
関連記事 ↓
新着ニュース