Ming-Flash-Omni: Các công nghệ chính và thực tiễn của một mô hình đa phương thức hợp nhất
Tại QCon Bắc Kinh 2026, chuyên gia thuật toán cấp cao của Tập đoàn Ant là Guo Qingpei đã trình bày chi tiết về quá trình phát triển Ming-Flash-Omni, một mô hình hợp nhất đa phương thức với tham số nghìn tỷ. Bài trình bày đề cập đến kiến trúc hợp nhất với multi-router và AnyExperts, chiến lược huấn luyện hợp tác, cũng như các tối ưu hóa kỹ thuật, đạt được kết quả tiên tiến nhất trên các phương thức.
Guo Qingpei đến từ Ant Group đã trình bày kiến trúc kỹ thuật và các thực tiễn triển khai đằng sau Ming-Flash-Omni, một mô hình hợp nhất toàn phương thức (full-modality unified model) với quy mô hàng trăm tỷ tham số, tại hội nghị QCon Global Software Development Conference 2026 Beijing. Mô hình này hợp nhất khả năng hiểu âm thanh, video, hình ảnh và văn bản cùng với các tác vụ sinh nội dung trong một khung kiến trúc duy nhất.
Để giải quyết bài toán hợp nhất phương thức, nhóm phát triển đã thiết kế cơ chế đa bộ định tuyến (multi-router) nhằm xử lý việc định tuyến chuyên gia (expert routing) theo từng loại phương thức, cùng với AnyExperts – cơ chế phân bổ chuyên gia một cách linh động dựa trên mức độ quan trọng của token, giúp giảm sự dư thừa trong các token hình ảnh và video. Họ cũng giới thiệu một chiến lược huấn luyện phối hợp với việc hoạch định tỷ lệ dữ liệu và điều chỉnh tốc độ học động dựa trên tốc độ hội tụ.
Về mặt hợp nhất tác vụ, nhóm xây dựng dựa trên một backbone hiểu đa phương thức được đóng băng (frozen), bổ sung thêm khả năng sinh hình ảnh và tổng hợp giọng nói, đồng thời tăng cường kiến thức thị giác chi tiết thông qua huấn luyện phân đoạn sinh (generative segmentation training), một phương pháp thông tin hai luồng (dual-stream) để bảo toàn tính nhận dạng, và việc trích xuất riêng biệt các đặc trưng chữ in nhằm tránh hiện tượng văn bản bị lỗi hoặc biến dạng. Khả năng sinh giọng nói được cải thiện với các tính năng điều khiển phương ngữ, cảm xúc và âm sắc tùy chỉnh, cùng khả năng sinh đồng thời giọng nói, âm thanh và âm nhạc.
Mô hình đạt kết quả thuộc hàng tiên tiến nhất (state-of-the-art) trên nhiều phương thức, tương đương hoặc vượt trội so với các mô hình chuyên biệt, và là mô hình hợp nhất toàn phương thức mã nguồn mở đầu tiên đạt quy mô nghìn tỷ tham số. Các tối ưu hóa về mặt kỹ thuật bao gồm một cơ chế đóng gói chuỗi toàn phương thức (full-modality sequence packing) và các chiến lược song song linh hoạt, giúp nâng cao hiệu suất huấn luyện lên tới 67%.
Nhóm nghiên cứu cũng đã khám phá việc hợp nhất ở cấp độ biểu diễn (representation-level) thông qua hai dự án mã nguồn mở là MingTok và MingTok-Audio, minh chứng cho một khung kiến trúc hợp nhất có thể áp dụng cho cả việc hiểu và sinh hình ảnh lẫn âm thanh.
Nguồn: InfoQ 中国 —
bản gốc
