全球首个Agentic扩散模型:行动中自我纠错,128K上下文媲美自回归模型
蚂蚁集团 inclusionAI 团队发布 LLaDA 2.2,这是全球首个具有128K原生上下文的规模化agent扩散模型。它融合了莱文斯坦编辑、环境反馈的强化学习以及BlockRouting架构,在智能体基准测试中达到接近顶尖自回归模型的性能,同时提供更高的吞吐量。
蚂蚁集团 inclusionAI 团队开源了 LLaDA 2.2,这是一个千亿参数的 MoE(混合专家)扩散语言模型,支持 128K 原生上下文。它是首个大规模智能体扩散模型,使模型能够同时生成和修正其输出。该模型采用莱文斯坦编辑范式,通过四种原子操作(KEEP、SUBSTITUTE、DELETE、INSERT)来动态修改生成内容。它还引入了 L-EBPO(莱文斯坦编辑证据下界策略优化),将多轮编辑决策视为基于环境反馈的强化学习问题。为处理长上下文,模型采用了 BlockRouting,即在词元级路由之前,先在块级别选择固定专家池,从而减少高带宽内存(HBM)流量和通信成本。在七项智能体基准测试中,LLaDA 2.2-flash 得分为 53.83,而 Ling-2.6-flash 为 55.74,表现相当,同时在 BF16 格式下的平均吞吐量达到 1.64 倍,采用 FP8 量化后进一步提升了 18.6%。这证明了扩散模型在智能体任务中能够与自回归模型相匹敌,并将在未来的智能体系统中共存。
来源: QbitAI 量子位 —
原文
