النماذجالأعمال والسوق 🇺🇸 31.07.2026 09:02

PolyAI تقدم Dialog-RSN-1: نموذج حوار صوتي أصلي يجمع بين إدارة الردود والتعرف على الكلام واستدعاء الوظائف وتوليد الردود

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
أصدرت PolyAI نموذج Dialog-RSN-1، وهو نموذج حوار صوتي أصلي يعالج الصوت مباشرة، ويدمج إدارة الردود والتعرف على الكلام واستدعاء الوظائف وتوليد الردود. يُستخدم النموذج بالفعل في الإنتاج، حيث يوفر استجابات في أقل من 300 مللي ثانية ويحسن الأداء بنسبة 11% في كبح الاسترسال و37% في زمن الاستجابة. وهو متاح فقط عبر منصة PolyAI، دون أوزان مفتوحة أو واجهة برمجة تطبيقات عامة.
أعلنت PolyAI عن نموذجها Dialog-RSN-1، وهو نموذج محادثة يدرك الصوت الصادر من المتصل مباشرة، بدلاً من الاعتماد على قراءة نص المحادثة. يجمع هذا النموذج بين إدارة تدفق الحوار والتعرف على الكلام واستدعاء الوظائف وتوليد الردود في نموذج واحد يعمل بالصوت مباشرة، وهو يعالج بالفعل مكالمات حية في بيئات الإنتاج. يعتمد النموذج على الصوت كمدخل، لكن تقنية تحويل النص إلى كلام (TTS) تظل منفصلة، مما يتيح التحكم في الصوت. يعمل النموذج عند الطلب وليس كتدفق مستمر، مما يمنع إرهاق وحدات معالجة الرسوميات (GPU) بشكل دائم. الناتج الأول للنموذج هو قرار بشأن الرد: فارغ (EMPTY) أو مستمر (ONGOING) أو مكتمل (COMPLETE). تذكر PolyAI أن زمن الاستجابة أقل من 300 مللي ثانية، مع تحسن نسبي في التحكم بالحوار بنسبة 11% لدى مجموعة مطاعم، وانخفاض في التأخير بنسبة 37% لدى شركة تأمين. النموذج متاح حصرياً عبر منصة PolyAI، دون أوزان مفتوحة أو واجهة برمجة تطبيقات عامة، ويدعم اللغة الإنجليزية فقط. من الناحية المعمارية، يتضمن تدريباً لاحقاً لنماذج متعددة الوسائط ذات أوزان مفتوحة باستخدام ضبط دقيق خاضع للإشراف والتعلم المعزز (RL) على بيانات خاصة. قامت PolyAI بتقييم عدة نماذج بما في ذلك Gemma وGPT-OSS وQwen وMistral. يتضمن تحسين زمن الاستجابة تهيئة مسبقة لذاكرة الانتباه (cache)، ونمطاً للإدخال النصي (prompt) مع إضافات، وتوجيه كل متصل إلى نفس وحدة معالجة الرسوميات (GPU)، وكتابة تخمينية بمتوسط قبول 3.9 رموز، واستدلالاً ذاتياً تعلّمه النموذج أثناء التدريب المعزز (RFT). يتم النسخ في المرحلة الأخيرة، بالتوازي مع توليد الكلام. قامت PolyAI بتقييم النموذج على معيار داخلي يُدعى Dialog-Eval، وتخطط لإتاحته للجمهور. بالنسبة للغات غير الإنجليزية، يُنصح باستخدام Raven 3.5. كما تخطط لنشر تقرير فني ومقال حول Dialog-Eval.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة