NVIDIA تكشف عن نموذج NemotronLabs VoiceChat 11B مفتوح المصدر للكلام الكامل الاتجاه مع زمن استجابة 450 مللي ثانية واستدعاء أدوات مباشر
NVIDIA
أصدرت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج مفتوح المصدر للكلام إلى كلام كامل الاتجاه، يقوم بفهم وتوليد الكلام التدفقي في شبكة واحدة، محققًا زمن استجابة يبلغ 448 مللي ثانية. وهو أول نموذج مفتوح المصدر كامل الاتجاه يدعم استدعاء الأدوات أثناء المحادثة، باستخدام قناة جانبية ورسائل انتظار محددة من المشغل. النموذج متاح لمشاريع بحثية تجريبية فقط، ويتطلب وحدة معالجة رسومية بسعة 80 جيجابايت، ولا توجد حتى الآن واجهة برمجة تطبيقات مستضافة.
أصدرت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج مفتوح 11B من نوع الكلام إلى الكلام (end-to-end) للمحادثة الكاملة الازدواج في الوقت الفعلي. على عكس الأنظمة المتتالية (cascaded)، يوحّد هذا النموذج فهم الكلام وتوليده في شبكة واحدة، مما يلغي الحاجة إلى تنسيق نماذج متعددة ويقلل زمن الاستجابة إلى 448 ميلي ثانية على معيار Full-Duplex-Bench 1.0. يسمح النموذج بالمقاطعة، بمعدل استحواذ يصل إلى 1.00 عند 480 ميلي ثانية. كما أنه رائد في استدعاء الأدوات في نموذج مفتوح كامل الازدواج، حيث يُصدر نصوص <TOOLCALL> على قناة منفصلة ويستخدم خطوط انتظار محددة من قبل المُشغِّل لتجنب الصمت أثناء تشغيل واجهات برمجة التطبيقات. يجمع النموذج بين مُرمِّز الكلام Fast Conformer من Nemotron-Speech-Streaming-En-0.6b، والعمود الفقري Nemotron Nano v2 LLM، ووحدة فك ترميز NVIDIA TTS، وتدرب على حوالي 550 ألف ساعة من الصوت. ومع ذلك، فهو لأغراض البحث فقط، مع وجود أنماط فشل موثقة مثل حد سياق الصوت البالغ دقيقتين وتدهور الأداء بعد عدة جولات. يتطلب النموذج وحدة معالجة رسومية واحدة بسعة 80 غيغابايت (مثل A100 أو H100 أو RTX 6000 Pro أو B200) ولا يوفر واجهة برمجة تطبيقات مستضافة. تشمل القيود حدًا أقصى لخمسة أدوات في الجلسة الواحدة ومطالبات نظام بأحرف ASCII فقط. تشمل نتائج الأداء 58.5٪ في استدعاء الأدوات البسيط على AU Harness BFCL-v3 و82.5٪ في اختيار الأدوات على Full-Duplex-Bench v3. يحتل النموذج المرتبة الثانية بين النماذج المفتوحة كاملة الازدواج على VoiceBench وFull-Duplex-Bench 1.0.
المصدر: MarkTechPost —
الأصلي
