Ming-Flash-Omni: Tecnologías clave y prácticas de un modelo unificado de multimodalidad completa
En QCon Beijing 2026, el experto senior en algoritmos de Ant Group, Guo Qingpei, detalló el desarrollo de Ming-Flash-Omni, un modelo unificado de multimodalidad completa con mil billones de parámetros. La charla cubrió una arquitectura unificada con multi-enrutador y AnyExperts, una estrategia de entrenamiento colaborativo y optimizaciones de ingeniería, logrando resultados de vanguardia en todas las modalidades.
Guo Qingpei, de Ant Group, presentó la arquitectura técnica y las prácticas detrás de Ming-Flash-Omni, un modelo unificado de modalidad completa con cientos de miles de millones de parámetros, en la QCon Global Software Development Conference 2026 celebrada en Pekín (Beijing). El modelo unifica la comprensión de audio, video, imagen y texto con tareas de generación dentro de un único marco de trabajo. Para abordar la unificación de modalidades, el equipo diseñó un mecanismo de enrutamiento múltiple (multi-router) encargado de gestionar el enrutamiento de expertos específico para cada modalidad, junto con AnyExperts, que asigna expertos de forma dinámica según la importancia de cada token, reduciendo así la redundancia en los tokens de imagen y video. Asimismo, introdujeron una estrategia de entrenamiento colaborativo con planificación de proporciones de datos y ajuste dinámico de la tasa de aprendizaje en función de la velocidad de convergencia. Para la unificación de tareas, partieron de una estructura base (backbone) de comprensión multimodal congelada, a la que añadieron capacidades de generación de imágenes y síntesis de voz, complementadas con conocimiento visual de grano fino mediante entrenamiento de segmentación generativa, un enfoque de doble flujo de información para la preservación de identidad, y la extracción independiente de características tipográficas para evitar texto ilegible o distorsionado. La generación de voz se mejoró con controles de dialecto, emoción y timbre personalizado, además de la generación simultánea de voz, sonido y música. El modelo logró resultados de vanguardia (state-of-the-art) en todas las modalidades, igualando o superando a modelos especializados, y constituye el primer modelo unificado de modalidad completa de código abierto con billones de parámetros (en la escala anglosajona, thousand-billion, equivalente a billón en español). Las optimizaciones de ingeniería incluyeron un esquema de empaquetado de secuencias de modalidad completa y estrategias de paralelismo flexibles, que mejoraron la eficiencia del entrenamiento en un 67%. El equipo también exploró la unificación a nivel de representación con los proyectos de código abierto MingTok y MingTok-Audio, demostrando un marco unificado tanto para la comprensión como para la generación de imagen y audio.
Fuente: InfoQ 中国 —
original
