Black Forest Labs выпускает FLUX 3: мультимодальная модель для изображений, видео, аудио и прогнозирования действий роботов
Luma AI
Runway
xAI
Google/DeepMind
Black Forest Labs (BFL) представила FLUX 3 — мультимодальную фундаментальную модель, обученную на изображениях, видео и аудио в единой архитектуре. Модель генерирует видео до 20 секунд с синхронным аудио и показывает высокие результаты в предпочтениях пользователей, превосходя Luma Ray 3.2 в 93% случаев и Runway Gen-4.5 в 77%.
Команда Black Forest Labs (BFL) выпустила FLUX 3 — мультимодальную фундаментальную модель, которая обучается на изображениях, видео и аудио в единой архитектуре. Это первая модель FLUX, способная генерировать видео, аудио и прогнозировать действия из одного набора весов. Исследователи BFL утверждают, что ни одна отдельная модальность не даёт полного описания мира: изображения фиксируют
Показать ещё ↓
Источник: MarkTechPost —
оригинал
