пространственную структуру в один момент, видео восстанавливает время и раскрывает физическую динамику, аудио выявляет причинно-следственные связи между механическими событиями и звуком. Обучение на всех модальностях одновременно заставляет их ограничивать друг друга — звук должен соответствовать столкновению, движение — подчиняться массе. В основе модели лежит метод Self-Flow, который сочетает цель согласования потока с самонастраиваемой целью реконструкции признаков. Эталонная реализация на GitHub (ImageNet 256×256) использует SiT-XL/2 с покадровым временным кондиционированием, маской 25% и самодистилляцией от EMA-учителя на слое 20 к студенту на слое 8. Для FLUX 3 BFL значительно увеличила вычислительные и Data-ресурсы, обучая модель одновременно на видео, изображениях и аудио. FLUX 3 Video генерирует клипы до 20 секунд за один проход с нативным аудио, поддерживает режимы text-to-video, image-to-video, video-to-video, keyframe-to-video и генеративное продолжение видео-аудио. BFL также отмечает возможности многоязычного диалога, агентной сборки клипов в многосценарные последовательности и генерацию качественной типографики с анимацией. Особенно сильна модель в генерации человеческих выражений лица и ассоциации звуков с физическими событиями. В предварительных тестах предпочтений пользователей FLUX 3 победила Luma Ray 3.2 в 93% случаев, Runway Gen-4.5 — в 77%, Grok Imagine Video — до 69%, Kling v3 Pro — 60%, Happy Horse v1 — 59% и Happy Horse 1.1 — 57%. Против Seedance 2.0 и Gemini Omni Flash результат составил 52%. Видеопрогнозирование потребляет более 95% вычислительных ресурсов обучения, аудио — менее 0,5% токенов. Та же основа используется для FLUX-mimic — политики робота, работающей менее 80 мс на одном RTX 5090. Доступ ограничен: видео и действия — в раннем
Показать ещё ↓