⚡ 속보
모델미디어 생성 🇺🇸 26.07.2026 21:02

블랙 포레스트 랩스, FLUX 3 출시: 이미지, 비디오, 오디오 및 로봇 행동 예측을 위한 멀티모달 모델

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
블랙 포레스트 랩스(BFL)가 이미지, 비디오, 오디오 및 로봇 행동 예측을 공동으로 학습한 멀티모달 기반 모델인 FLUX 3를 소개합니다. 이 모델은 Self-Flow 아키텍처를 활용하여 모달리티를 정렬하며, 초기 테스트에서 텍스트-비디오 생성 분야에서 Luma Ray 3.2 및 Runway Gen-4.5와 같은 경쟁사보다 높은 선호도를 보였습니다.
블랙 포레스트 랩스(BFL)가 단일 아키텍처 내에서 이미지, 비디오, 오디오를 학습하는 멀티모달 기초 모델 FLUX 3를 출시했습니다. 이 모델은 하나의 가중치 세트로 비디오, 오디오, 행동 예측을 제공하는 최초의 FLUX 모델입니다. 연구팀은 단일 양식으로는 세상에 대한 완전한 설명을 제공할 수 없으며, 모든 양식을 동시에 훈련하면 서로를 제약한다고 주장합니다. FLUX 3는 BFL의 멀티모달 생성과 이해를 정렬하는 방법인 Self-Flow를 기반으로 구축되었으며, 이는 플로우 매칭 목적 함수와 자기 지도 방식의 특징 재구성 목적 함수를 결합합니다. FLUX 3 비디오는 기본 오디오와 함께 단일 생성으로 최대 20초 길이의 클립을 생성하며, 텍스트-비디오, 이미지-비디오, 비디오-비디오, 키프레임-비디오, 생성적 비디오-오디오 연속을 지원합니다. BFL은 인간의 표정과 소리와 물리적 사건의 연관에서 강력한 성능을 보고했습니다. 오디오가 포함된 720p 10초 텍스트-비디오 클립에 대한 예비 인간 선호도 테스트에서 FLUX 3는 Luma Ray 3.2 대비 93%, Runway Gen 4.5 대비 77%, Grok Imagine Video 대비 69%, Kling v3 Pro 대비 60%, Happy Horse v1 및 1.1 대비 각각 59%와 57%의 선호도를 기록했습니다. Seedance 2.0 및 Gemini Omni Flash에 대해서는 52%를 기록했습니다. 비디오 예측은 훈련 컴퓨팅의 95% 이상을 소비하며, 오디오는 0.5% 미만의 토큰을 차지합니다. 동일한 백본은 RTX 5090 하나에서 80밀리초 미만의 로봇 정책인 FLUX-mimic을 실행합니다. 접근은 제한되어 있습니다: 비디오와 행동은 얼리 액세스, 이미지는 그 다음, 오픈 가중치는 마지막입니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스