模型研究 🇨🇳 05.08.2026 12:01

Ming-Flash-Omni:全模态统一模型的关键技术与实践

在2026年北京QCon大会上,蚂蚁集团高级算法专家郭清沛详解了千亿参数全模态统一模型Ming-Flash-Omni的开发过程。演讲涵盖了采用多路由和AnyExperts的统一架构、协同训练策略以及工程优化,在各模态上均取得了领先水平的结果。
蚂蚁集团的郭清沛在2026年北京QCon全球软件开发大会上,介绍了百亿参数全模态统一模型Ming-Flash-Omni背后的技术架构与实践。该模型在单一框架内统一了音频、视频、图像和文本的理解与生成任务。为解决模态统一问题,团队设计了多路由器机制,用于处理模态特定的专家路由,并提出了AnyExperts,根据令牌重要性动态分配专家,从而减少图像和视频令牌中的冗余。他们还引入了一种协作训练策略,包括数据比例规划和基于收敛速度的动态学习率调整。在任务统一方面,他们基于冻结的多模态理解骨干,增加了图像生成和语音合成能力,并通过生成式分割训练补充了细粒度视觉知识,采用双流信息方法保持身份特征,并单独提取排版特征以避免文字乱码。语音生成增强了方言、情感和自定义音色控制,并支持语音、声音和音乐的同时生成。该模型在各模态上均达到了业界领先水平,可与专门模型媲美甚至超越,是首个开源千亿参数全模态统一模型。工程优化包括全模态序列打包方案和灵活的并行策略,将训练效率提升了67%。团队还通过开源项目MingTok和MingTok-Audio探索了表示级统一,展示了图像和音频理解与生成的统一框架。
来源: InfoQ 中国 — 原文
我们之前关于此话题的帖子 ↓
最新新闻