بناء خط أنابيب شامل لتوليد الفيديو والصوت باستخدام MiniMax-H3 وواجهات برمجة تطبيقات ComfyUI
ComfyUI
Hugging Face
يشرح هذا البرنامج التعليمي كيفية تنفيذ سير عمل شامل لتوليد الفيديو باستخدام MiniMax-H3، معتمدًا على ComfyUI كخادم استدلال بدون واجهة رسومية. يغطي إعداد البيئة، والتنزيل التلقائي لأوزان النماذج من Hugging Face، وبناء الرسوم البيانية المدركة للمخطط، وفك ترميز الفيديو والصوت المشترك، وعدة أوضاع للتوليد، كل ذلك دون الحاجة إلى واجهة المستخدم الرسومية.
يقوم سير العمل هذا بإعداد ComfyUI برمجيًا، مع تكوين ذاكرة GPU، وسعة القرص، ودقة النموذج، والدقة، والمدة، وأخذ العينات، وأوضاع التوليد. ويختار ديناميكيًا ملف تعريف الأوزان بناءً على قدرات الأجهزة. ويتم تنزيل أوزان الانتشار، وترميز النصوص، وترميز الفيديو (VAE)، وترميز الصوت (VAE) المطلوبة من Hugging Face، ويتواصل الخادم عبر واجهات برمجة تطبيقات HTTP و WebSocket. يتم بناء الرسم البياني للتنفيذ في Python، مع التحقق من صحة مخططات العقد مقابل /object_info. تتضمن الأوضاع المدعومة النص إلى فيديو، والتوليد المشروط بالإطار الأول والأخير، والتوليد المشروط بالصورة المرجعية. تدمج هذه العملية إعداد النموذج تلقائيًا، وبناء الرسم البياني المدرك للمخطط، وفك تشفير الفيديو والصوت المشترك، ومراقبة التقدم، وجمع المخرجات.
المصدر: MarkTechPost —
الأصلي
