MiniMax phát hành MiniMax H3: Mô hình video đa phương thức tạo clip 2K 15 giây với âm thanh nổi gốc
MiniMax
Google/DeepMind
ByteDance
MiniMax đã công bố MiniMax H3, một mô hình tạo sinh đa phương thức đa năng hợp nhất xử lý văn bản, hình ảnh, video và âm thanh, xuất ra video 2K với âm thanh nổi gốc. Mô hình này có sẵn qua API và trong ứng dụng Hailuo AI, với trọng số mở được hứa hẹn sớm ra mắt. Được định giá cạnh tranh, H3 dẫn đầu trong chỉnh sửa video nhưng tụt hậu so với các đối thủ ở các tiêu chuẩn đánh giá khác.
MiniMax đã phát hành MiniMax H3, một mô hình tạo sinh đa phương thức đa năng có thể đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh thống nhất và trả về video có âm thanh nổi gốc, hỗ trợ độ phân giải 2K, thời lượng từ 4 đến 15 giây (chỉ số nguyên). Khác với các hệ thống trước đây yêu cầu các mô hình riêng biệt cho văn bản thành video, hình ảnh thành video và các tác vụ khác, H3 gộp chúng vào một mô hình tiền huấn luyện duy nhất, trong đó các mối quan hệ được diễn đạt bằng ngôn ngữ tự nhiên, chẳng hạn như tham chiếu chuyển động camera từ video hoặc khớp giọng hát với âm thanh. Mô hình được phát hành vào ngày 31 tháng 7 năm 2026, có sẵn qua API với mã mô hình MiniMax-H3 và trong ứng dụng tiêu dùng Hailuo AI. Mô hình được định vị cho quảng cáo, xây dựng thương hiệu, thương mại điện tử, thiết kế sản phẩm, UI/UX, trò chơi, tiền dựng phim và phương tiện truyền thông danh mục bán lẻ, với các ứng dụng bao gồm biến thể quảng cáo, video sản phẩm, áp phích động và chuyển chuyển động video sang video. API hỗ trợ ba chế độ đầu vào: văn bản thành video, hình ảnh thành video với khung đầu/cuối, và tạo sinh tham chiếu, với giới hạn đầu vào bao gồm tối đa 9 hình ảnh tham chiếu, 3 video tham chiếu (mỗi video 2-15 giây, tổng ≤15 giây) và 3 clip âm thanh tham chiếu (âm thanh yêu cầu kèm hình ảnh/video). Giới hạn đầu vào hỗn hợp là 12 tệp; lời nhắc ≤7.000 ký tự; thân yêu cầu ≤64 MB; kích thước tệp: video ≤50 MB, hình ảnh ≤30 MB, âm thanh ≤15 MB. Các định dạng bao gồm video H.264/H.265, hình ảnh JPG/PNG/WEBP/HEIC/HEIF và âm thanh WAV/MP3. Bốn thành phần kỹ thuật tạo nên hiệu suất của nó: Biểu diễn Omni theo ngữ cảnh (chú thích mô tả các mối quan hệ, giảm từ khoảng 100.000 token xuống còn khoảng 4.000), H3-VAE (một bộ mã hóa token với tăng hiệu quả độ dài chuỗi gấp 4 lần cho phép 2K gốc), Bộ biến đổi Omni H3 (tách biệt khối lượng công việc hiểu và tạo sinh, tăng thông lượng huấn luyện khoảng 30%) và Tái tạo trong ngữ cảnh (mô hình cơ sở tái tạo đầu ra độ phân giải thấp trong ngữ cảnh thay vì gắn thêm siêu phân giải). Tuyên bố về giá: ở 2K, giá mỗi giây thấp hơn một phần ba so với các mô hình chính thống; ở 768p, thấp hơn một nửa so với 720p chính thống. Các bên theo dõi bên thứ ba báo cáo 0,13 đô la mỗi giây (khoảng 1,95 đô la cho một clip 15 giây), nhưng trang trả tiền theo mức sử dụng của MiniMax vẫn liệt kê các gói Hailuo 2.3. Theo SCMP trích dẫn Artificial Analysis, H3 dẫn đầu trong chỉnh sửa video, xếp sau Gemini Omni Flash của Google trong văn bản thành video và xếp sau Seedance 2.0 và Gemini Omni Flash trong hình ảnh thành video. Trọng số mở được hứa hẹn 'trong những ngày tới' nhưng chưa được phát hành.
Nguồn: MarkTechPost —
bản gốc
