النماذجتوليد الوسائط 🇺🇸 26.07.2026 21:02

بلاك فورست لابز تطلق FLUX 3: نموذج متعدد الوسائط للصور والفيديو والصوت والتنبؤ بأفعال الروبوتات

Luma AILuma AI RunwayRunway xAIxAI Google/DeepMindGoogle/DeepMind
أعلنت شركة بلاك فورست لابز (BFL) عن إطلاق FLUX 3، وهو نموذج أساسي متعدد الوسائط تم تدريبه على الصور والفيديو والصوت ضمن بنية واحدة. يولد النموذج مقاطع فيديو تصل مدتها إلى 20 ثانية مع صوت متزامن، ويحقق نتائج عالية من حيث تفضيل المستخدم، متجاوزًا Luma Ray 3.2 في 93% من الحالات و Runway Gen-4.5 في 77%.
أعلنت شركة Black Forest Labs (BFL) عن إطلاق نموذج FLUX 3، وهو نموذج أساسي متعدد الوسائط يتم تدريبه على الصور والفيديو والصوت في بنية واحدة. يُعد هذا أول نموذج FLUX قادر على توليد الفيديو والصوت والتنبؤ بالإجراءات من مجموعة واحدة من الأوزان. يجادل باحثو BFL بأن أي وسيلة منفردة لا تقدم وصفًا كاملاً للعالم: حيث تلتقط الصور البنية المكانية في لحظة واحدة، ويعيد الفيديو بناء الزمن ويكشف عن الديناميكيات الفيزيائية، ويكشف الصوت عن العلاقات السببية بين الأحداث الميكانيكية والصوت. يؤدي التدريب على جميع الوسائط في وقت واحد إلى تقييد بعضها البعض - يجب أن يتطابق الصوت مع الاصطدام، ويجب أن تخضع الحركة للكتلة. أساس النموذج هو طريقة Self-Flow، التي تجمع بين هدف محاذاة التدفق وهدف إعادة بناء الميزات ذاتي الضبط. يستخدم التنفيذ المرجعي على GitHub (ImageNet 256×256) SiT-XL/2 مع توقيت زمني إطاري، وقناع بنسبة 25%، والتقطير الذاتي من معلم EMA على الطبقة 20 إلى طالب على الطبقة 8. بالنسبة لـ FLUX 3، قامت BFL بزيادة الموارد الحسابية وبيانات التدريب بشكل كبير، حيث دربت النموذج في وقت واحد على الفيديو والصور والصوت. يقوم FLUX 3 Video بتوليد مقاطع فيديو تصل إلى 20 ثانية في تمريرة واحدة مع صوت أصلي، ويدعم أوضاعًا مثل النص إلى فيديو، والصورة إلى فيديو، والفيديو إلى فيديو، والإطار الرئيسي إلى فيديو، والتمديد التوليدي للفيديو والصوت. وتشير BFL أيضًا إلى إمكانيات الحوار متعدد اللغات، وتجميع المقاطع بواسطة وكيل في تسلسلات متعددة المشاهد، وتوليد طباعة عالية الجودة مع رسوم متحركة. النموذج قوي بشكل خاص في توليد تعبيرات الوجه البشرية وربط الأصوات بالأحداث الفيزيائية. في الاختبارات التفضيلية الأولية، تفوق FLUX 3 على Luma Ray 3.2 في 93% من الحالات، وعلى Runway Gen-4.5 في 77%، وعلى Grok Imagine Video بنسبة تصل إلى 69%، وعلى Kling v3 Pro بنسبة 60%، وعلى Happy Horse v1 بنسبة 59%، وعلى Happy Horse 1.1 بنسبة 57%. أما مقابل Seedance 2.0 وGemini Omni Flash فكانت النتيجة 52%. يستهلك التنبؤ بالفيديو أكثر من 95% من الموارد الحاسوبية للتدريب، بينما يستهلك الصوت أقل من 0.5% من الرموز المميزة. ويُستخدم الأساس نفسه في FLUX-mimic، وهي سياسة روبوت تعمل بأقل من 80 مللي ثانية على بطاقة RTX 5090 واحدة. الوصول محدود: الفيديو والإجراءات متاحة في الوصول المبكر، والصور ستأتي لاحقًا، والأوزان المفتوحة ستأتي أخيرًا.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة