готовое к публикации видео с разрешением по умолчанию 2K. Модель получила высокие оценки зарубежных разработчиков и возглавила рейтинг Artificial Analysis в категории видеомонтажа. Автор протестировал H3 и обнаружил, что она очень точно улавливает намерения пользователя, даже корректно следуя сложным многосценарным запросам. H3 также демонстрирует значительное улучшение в генерации текста в видео — это было частым слабым местом ИИ-видеомоделей. Модель может генерировать текст, который остается согласованным между кадрами, и даже понимает связь между текстом и визуальным содержанием. Кроме того, H3 может принимать аудиофайл в качестве входных данных для диалога, при этом голос синхронизирован с эмоциями и ритмом изображения, что опирается на опыт MiniMax в области мультимодальных голосовых моделей. Цена низкая: стоимость секунды видео в разрешении 2K составляет менее одной трети от стоимости主流 моделей. H3 поддерживает полный мультимодальный ввод, то есть все типы медиа являются частью контекста модели. В ней используются специальная модель подписей и архитектура H3-Omni Transformer для эффективной мультимодальной обработки. Подход MiniMax основан на идее появления мультимодальности плюс языка, связывая изолированные модальности через язык. Открытый характер H3 позволяет предприятиям развертывать модель в частном порядке и дорабатывать ее для пользовательских рабочих процессов создания контента, что потенциально может привести к всплеску активности в области интеллектуальной собственности. MiniMax имеет историю открытия своих моделей — от серии M2 до нынешней H3, что соответствует ее видению «Интеллект для каждого». Выпуск знаменует переход видеогенерации в «момент программирования», когда она становится коммерчески жизнеспособным производственным инструментом.