بايت دانس تكشف عن SeedRealtime: نموذج لغوي متعدد الوسائط ثنائي الاتجاه يرى ويسمع ويتحدث في نموذج واحد
ByteDance
قدّم فريق Seed في شركة بايت دانس نموذج SeedRealtime، وهو نموذج لغوي كبير متعدد الوسائط ثنائي الاتجاه يجمع بين الصوت والفيديو والنص في بنية موحدة للتفاعل المستمر في الوقت الفعلي. يهدف النموذج إلى استبدال خطوط الأنابيب المتتالية للتعرف التلقائي على الكلام، ونماذج الرؤية واللغة، وتوليف الكلام بنموذج واحد متكامل، مما يتيح الكلام الاستباقي وتناوب الأدوار الطبيعي. يتم نشر النموذج حاليًا في تطبيق دوباو التابع لبايت دانس، دون الإفراج عن أي تقرير تقني أو معايير أو أوزان أو واجهة برمجة تطبيقات.
كشفت فريق Seed في ByteDance عن SeedRealtime، وهو نموذج لغوي كبير أصلي للتواصل الكامل بالصوت والصورة، يدمج الصوت والفيديو والنص في بنية واحدة شاملة من البداية إلى النهاية. على عكس الأنظمة المتتالية التقليدية التي تربط وحدات التعرف التلقائي على الكلام، ونماذج اللغة والرؤية، وتحويل النص إلى كلام، يقوم SeedRealtime بأداء الإدراك والفهم واتخاذ القرار والتعبير بالتوازي، كما يتعامل مع تبديل الأدوار داخليًا، مما يلغي الحاجة إلى كاشف نشاط صوتي خارجي. تدعي الشركة ثلاثة إنجازات رئيسية: الفهم المشترك للصوت والصورة، والتفاعل الاستباقي، والتوقيت الطبيعي للمحادثة. في العروض التوضيحية، نجح النموذج في مطابقة الأسماء مع الوجوه في البيئات الصاخبة، وتذكير المستخدمين بشكل استباقي عند ظهور كائن معين في مجال رؤية الكاميرا، وتصحيح خطوات تحضير الإسبريسو بناءً على الحالة البصرية، وكتم الضوضاء غير ذات الصلة أثناء استرجاع معلومات خارج الشاشة. يتم حاليًا نشر SeedRealtime في تطبيق Doubao التابع لشركة ByteDance، لكن الشركة لم تنشر تقريرًا فنيًا أو عدد المعلمات أو الأوزان المفتوحة أو واجهة برمجة تطبيقات، مما يجعله غير متاح للتكامل مع الجهات الخارجية. تشير التقييمات الداخلية لشركة ByteDance إلى أن مشكلات الإيقاع تنخفض إلى النصف مقارنة بالأنظمة المتتالية، لكن لم يتم تقديم أي معايير أو أرقام زمن الوصول.
المصدر: MarkTechPost —
الأصلي
