蚂蚁百灵发布全新混合推理模型Ling-3.0-Flash
蚂蚁百灵正式发布其原生混合推理模型Ling-3.0-Flash,总参数量124B,每次计算仅激活5.1B。它在推理、指令遵循和长上下文任务上匹敌或超越尺寸大2-3倍的模型,效率更高。该模型已在OpenRouter上线,提供限时一周免费体验,随后将开源。
7月24日,蚂蚁百灵发布Ling-3.0-Flash模型,总参数量达1240亿,每步激活参数51亿,性能媲美2至3倍规模模型,同时降低计算成本。该模型专为智能体应用设计,拥有超过1万个真实交互环境,改进了自我纠错与长期规划能力。模型采用混合注意力架构,KDA线性注意力与MLA层比例为5:1,并将闪电注意力升级为KDA以提升状态追踪。每token专家激活比例从1/32降至1/64,效率提升。工程改进包括集群级缓存,使首词延迟降低60%至80%,以及多智能体协作框架以增强稳定性。
来源: QbitAI 量子位 —
原文
