النماذجالأبحاث 🇷🇺 06.08.2026 07:03

معيار أداء 23 نموذجًا للتعرف على الكلام للإملاء الروسي في مجال تكنولوجيا المعلومات: توصيتي في مارس أصبحت قديمة

OpenAIOpenAI
أعاد مطور تقييم نماذج تحويل الصوت إلى نص للإملاء الروسي في مجال تكنولوجيا المعلومات، حيث اختبر 23 نموذجًا للتعرف على الكلام في أكثر من 60 تكوينًا مع 100,000 عملية تشغيل. ووجد أن Breeze ASR، وهو اكتشاف غير متوقع، يطابق أو يتجاوز Whisper Large v3، مما أدى إلى تحديث التوصية. ويقدم المعيار مقياسًا مركبًا Q يجمع بين معدل خطأ الكلمات، ودقة علامات الترقيم، ومؤشر الحفاظ على اللغة الإنجليزية الجديد (EPI) لمكافأة النماذج التي تحافظ على المصطلحات الإنجليزية بالحروف اللاتينية.
في شهر مارس، أوصى المؤلف بنموذج Whisper Large v3 للإملاء بتقنية المعلومات باللغة الروسية، لكنه اكتشف لاحقًا نموذج Breeze ASR، وهو نموذج محسّن للغة الصينية المندرينية التايوانية مع دعم لتبديل اللغات، وكان أداؤه جيدًا على الأقل بنفس المستوى. للتحقق من ذلك، قام ببناء معيار تقييم دقيق: 23 نموذجًا في أكثر من 60 تكوينًا، وأكثر من 100,000 عملية تشغيل على مجموعة نصوص باللغتين الروسية والإنجليزية في مجال تقنية المعلومات، باستخدام أكثر من 120 ساعة من الاستدلال على بطاقة RTX 5070 Ti. تتضمن المجموعة متحدثين اثنين (المؤلف وزوجته) يقرآن نصوصًا طويلة بكثافات مختلفة من المصطلحات الإنجليزية في مجال تقنية المعلومات. المقياس المركب Q (0.65 معدل الخطأ في الكلمات + 0.10 جودة علامات الترقيم + 0.25 مؤشر الإملاء الإنجليزي) يوازن بين دقة الكلمات وجودة علامات الترقيم والحفاظ على المصطلحات الإنجليزية بالحروف اللاتينية. يتم تطبيع معدل الخطأ في الكلمات بحيث لا يعاقب على التحويل الصوتي، بينما يكافئ مؤشر الإملاء الإنجليزي الأشكال الإنجليزية القياسية ويمنح ائتمانًا جزئيًا للاحتفاظ بالحروف اللاتينية بشكل غير كامل. تظهر النتائج أن نموذج Breeze ASR يتفوق على Whisper Large v3 في هذا المعيار، مما يجعل توصية شهر مارس قديمة. كما اختبر المؤلف عدة مطالبات لعلامات الترقيم ووجد أن المطالبة المخصصة تحسن علامات الترقيم بشكل كبير. تتيح صفحة المعيار التفاعلية تعديل الأوزان لتناسب سيناريوهات الإملاء المختلفة.
المصدر: Habr — хаб ML — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة