هوجينغ فيس وسيريبراس تتعاونان لتطوير الذكاء الاصطناعي الصوتي الفوري استنادًا إلى Gemma 4

Hugging FaceHugging Face Cerebras SystemsCerebras Systems NVIDIANVIDIA Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen
أعلنت هوجينغ فيس وسيريبراس عن إطلاق خط أنابيب مفتوح المصدر لتوليد الكلام في الوقت الفعلي باستخدام نموذج Gemma 4 من جوجل ديب مايند. يدمج النظام التعرف على الكلام من إنفيديا، والاستدلال من سيريبراس، وتوليف الكلام من علي بابا، مما يضمن زمن انتقال ضئيل للحوار الطبيعي. يمكن للمطورين تعديل وتوسيع كل مكون بالكامل.
أنشأت شركة Hugging Face بالتعاون مع Cerebras خط أنابيب مفتوح المصدر لتوليف الكلام في الوقت الفعلي يجعل التفاعل الصوتي مع الذكاء الاصطناعي طبيعيًا قدر الإمكان. يعمل النظام وفق مبدأ "إدخال الصوت -> التعرف على الكلام عبر Nvidia Parakeet -> الإخراج من نموذج اللغة متعدد الوسائط Gemma 4 (الذي طورته Google DeepMind) على مسرعات Cerebras -> تركيب الكلام عبر Qwen3TTS من Alibaba -> إخراج الصوت". كل مكون مفتوح ونمطي وقابل للاستبدال، مما يسمح للمطورين بتكييف المجموعة لاستخدامها في مساعداتهم أو روبوتاتهم أو مشاريعهم البحثية. يُولى اهتمام خاص لاستقرار زمن الوصول: على الرغم من أن العديد من الأنظمة تُظهر زمن وصول متوسط مقبول، إلا أنه عند المئين الخامس والتسعين (أي أبطأ 5% من الطلبات)، لا تزال تحدث توقفات متعددة الثواني. تحل Cerebras هذه المشكلة من خلال ضمان استدلال سريع ويمكن التنبؤ به لنموذج اللغة. يُستخدم خط الأنابيب هذا بالفعل في روبوتات Reachy Mini، التي يتوفر منها أكثر من 10,000 وحدة. يُدعى المطورون لتجربة العرض التوضيحي على Hugging Face Space وتجربة الكود من مستودع huggingface/speech-to-speech.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة