объединяет их в единую парадигму предобучения, где связи выражаются на естественном языке, например, ссылка на движение камеры из видео или согласование вокала с аудио. Модель запущена 31 июля 2026 года, доступна через API под идентификатором MiniMax-H3 и в потребительском приложении Hailuo AI. Она позиционируется для рекламы, брендинга, электронной коммерции, дизайна продуктов, UI/UX, игр, превизуализации фильмов и медиа розничных каталогов, с приложениями, включающими варианты рекламы, видеоролики о продуктах, анимированные постеры и перенос движения между видео. API поддерживает три режима входа: «текст-в-видео», «изображение-в-видео» по первому/последнему кадру и генерацию по эталону, с лимитами ввода, включая до 9 эталонных изображений, 3 эталонных видео (2–15 с каждое, всего ≤15 с) и 3 эталонных аудиоклипа (для аудио требуется сопутствующее изображение или видео). Смешанный ввод ограничен 12 файлами; промпты ≤7000 символов; тело запроса ≤64 МБ; размеры файлов: видео ≤50 МБ, изображение ≤30 МБ, аудио ≤15 МБ. Форматы включают H.264/H.265 для видео, JPG/PNG/WEBP/HEIC/HEIF для изображений и WAV/MP3 для аудио. Четыре технических компонента обеспечивают производительность: Contextual Omni Representation (описание, передающее связи, сжимающее ~100K токенов до ~4K), H3-VAE (токенизатор с 4-кратным выигрышем в эффективной длине последовательности, обеспечивающий нативное 2K), H3-Omni Transformer (разделяет понимание и генерацию, повышая пропускную способность обучения примерно на 30%) и In-Context Regeneration (базовая модель регенерирует вывод с низким разрешением в контексте вместо подключения суперразрешения). Заявленные цены: при 2K цена за секунду ниже трети стоимости мейнстримовых моделей; при 768p — ниже половины стоимости 720p у основных конкурентов. Сторонние

Показать ещё ↓