MiniMax H3: Mạng nơ-ron có thể đạo diễn, tạo âm thanh và tự chỉnh sửa
MiniMax đã phát hành H3 (còn được gọi là Hailuo 3.0), một mô hình AI đa phương thức tạo video với âm thanh đồng bộ, thực hiện chỉnh sửa theo video tham chiếu, và thậm chí xử lý tách nền xanh. Mô hình được mã nguồn mở theo giấy phép, với trọng số có sẵn trên Hugging Face, và hỗ trợ độ phân giải lên đến 2K qua API. Mục tiêu là hợp nhất xử lý văn bản, hình ảnh, video và âm thanh vào một ngữ cảnh duy nhất.
MiniMax đã giới thiệu H3, còn được gọi là Hailuo 3.0 hoặc Hailuo 03, một mô hình đa phương thức có khả năng tạo video dài 4-15 giây ở 24 khung hình/giây với âm thanh nổi gốc ở 32 kHz và độ phân giải lên đến 2K khi sử dụng qua API hoặc 768p khi tự triển khai. Mô hình này có thể xử lý đồng thời tối đa 9 ảnh tham chiếu, 3 video và 3 tệp âm thanh, đồng thời có thể chỉnh sửa video để khớp thời gian và phong cách của một đoạn clip tham chiếu. Nó cũng có khả năng loại bỏ phông xanh (green screen) và điều chỉnh ánh sáng. Kiến trúc của mô hình nén các nguồn thành mô tả ngôn ngữ (giảm từ khoảng 100 nghìn token xuống còn 4 nghìn), sử dụng bộ mã hóa VAE được thiết kế lại với độ dài chuỗi hiệu quả tăng gấp bốn lần, và bao gồm các quy trình tính toán riêng biệt cho hiểu và sinh nội dung. MiniMax đã phát hành trọng số của mô hình trên Hugging Face vào ngày 2-3 tháng 8 năm 2026, vài ngày sau khi ra mắt API vào ngày 31 tháng 7 năm 2026. Các buổi trình diễn cho thấy mô hình xử lý tốt các lời nhắc phức tạp cho việc chỉnh sửa, quảng cáo và chuyển cảnh mượt mà, nhưng vẫn gặp khó khăn với văn bản nhỏ trong video, một điểm yếu phổ biến của các mô hình tạo video dạng sinh.
Nguồn: Habr — хаб ИИ —
bản gốc
