⚡ عاجل
جوجل ديب مايند تقدم جيميني أومني: نموذج متعدد الوسائط لإنشاء وتحرير الفيديو
Google/DeepMind
DeepMind
أعلنت جوجل ديب مايند عن نموذج جديد يُدعى جيميني أومني، قادر على إنشاء فيديو استنادًا إلى أي مجموعة من المدخلات: الصور والصوت والفيديو والنص. الإصدار الأول، جيميني أومني فلاش، متاح بالفعل في تطبيق جيميني وجوجل فلو ويوتيوب شورتس، وسيكون متاحًا قريبًا للمطورين عبر واجهة برمجة التطبيقات.
أعلنت جوجل ديب مايند عن إطلاق نموذجها متعدد الوسائط الجديد جيميني أومني، الذي يجمع بين قدرات التفكير والإبداع. يستقبل النموذج الصور والصوت والفيديو والنصوص كمدخلات، ويُنتج مقاطع فيديو عالية الجودة بالاستناد إلى معرفة جيميني بالعالم الحقيقي. النسخة الأولى منه، جيميني أومني فلاش، متاحة بالفعل في تطبيق جيميني وجوجل فلو ويوتيوب شورتس (مجانًا لمستخدمي يوتيوب شورتس وتطبيق يوتيوب كرييت). كما تتوفر للاشتراكات في جوجل إيه آي بلس وبرو وألترا عالميًا. خلال الأسابيع المقبلة، سيصبح النموذج متاحًا للمطورين والعملاء من الشركات عبر واجهة برمجة التطبيقات (API). من أبرز ميزاته: إمكانية تحرير الفيديو عبر حوار باللغة الطبيعية (مع الحفاظ على تناسق الشخصيات والفيزياء والمشاهد)؛ إنتاج فيديوهات بفيزياء محسّنة (الجاذبية، الطاقة الحركية، ديناميكيات الموائع)؛ استخدام معرفة جيميني في التاريخ والعلوم والسياق الثقافي لسرد قصص واقعي؛ ودعم أي مزيج من المدخلات (صورة، نص، فيديو، صوت؛ الصوت حاليًا يقتصر على مراجع صوتية). لضمان الأمان، تم تطبيق علامة مائية رقمية غير مرئية باسم سينث آي دي، بالإضافة إلى أدوات التحقق من المحتوى عبر تطبيق جيميني وكروم وبحث جوجل. في المستقبل، سيتعلم النموذج توليد الصور والصوت.
المصدر: Google DeepMind —
الأصلي
