ModelosPesquisa 🇨🇳 05.08.2026 12:01

Ming-Flash-Omni: principais tecnologias e práticas de um modelo unificado para todas as modalidades

Na QCon Pequim 2026, o especialista sênior em algoritmos do Ant Group, Guo Qingpei, detalhou o desenvolvimento do Ming-Flash-Omni, um modelo unificado de todas as modalidades com um trilhão de parâmetros. A palestra abordou a arquitetura unificada com multi-router e AnyExperts, uma estratégia de treinamento colaborativo e otimizações de engenharia, alcançando resultados de ponta em todas as modalidades.
Guo Qingpei, da Ant Group, apresentou a arquitetura técnica e as práticas por trás do Ming-Flash-Omni, um modelo unificado de modalidade completa com centenas de bilhões de parâmetros, na Conferência Global de Desenvolvimento de Software QCon 2026, em Pequim. O modelo unifica tarefas de compreensão e geração de áudio, vídeo, imagem e texto em um único framework. Para lidar com a unificação de modalidades, a equipe projetou um mecanismo de múltiplos roteadores para lidar com o roteamento de especialistas específicos de cada modalidade e o AnyExperts, que aloca dinamicamente especialistas com base na importância dos tokens, reduzindo a redundância em tokens de imagem e vídeo. Eles também introduziram uma estratégia de treinamento colaborativo com planejamento de proporção de dados e ajuste dinâmico da taxa de aprendizado com base na velocidade de convergência. Para a unificação de tarefas, eles se basearam em uma espinha dorsal de compreensão multimodal congelada, adicionando capacidades de geração de imagem e síntese de fala, complementadas por conhecimento visual refinado por meio de treinamento de segmentação generativa, uma abordagem de informação de fluxo duplo para preservação de identidade e extração separada de características tipográficas para evitar texto ilegível. A geração de fala foi aprimorada com controles de dialeto, emoção e timbre personalizado, além da geração simultânea de fala, som e música. O modelo alcançou resultados de ponta em todas as modalidades, igualando ou superando modelos especializados, e é o primeiro modelo unificado de modalidade completa com mil bilhões de parâmetros de código aberto. As otimizações de engenharia incluíram um esquema de empacotamento de sequência de modalidade completa e estratégias paralelas flexíveis, melhorando a eficiência de treinamento em 67%. A equipe também explorou a unificação em nível de representação com os projetos de código aberto MingTok e MingTok-Audio, demonstrando um framework unificado para compreensão e geração de imagem e áudio.
Fonte: InfoQ 中国 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas