النماذجالأبحاث 🇷🇺 13.08.2026 00:05

كيف فشلت في جعل Gemma 4 تكتب شعرًا روسيًا جيدًا: قصة تحذيرية عن الإفراط في التخصيص والمقاييس العمياء

Google/DeepMindGoogle/DeepMind
قضى مهندس الذكاء الاصطناعي دانييل شيريميت شهرًا في ضبط نموذج Gemma 4 لكتابة الشعر الروسي بالوزن والقافية الصحيحة، لكن جميع النسخ المضبوطة كانت أقل أداءً من النموذج الأساسي. لم يكن السبب الحقيقي هو النموذج بل خطأ في خط التقييم: مُقيِّم مخصص لا يستطيع التمييز بين الشعر والنثر، بالإضافة إلى مشكلة في الترميز تتعلق بعلامات التشديد. بعد إصلاح المُقيِّم وإجراء اختبارات A/B صحيحة، فاز النموذج الأساسي، مما يسلط الضوء على درس مهم حول تقييم مخرجات نماذج اللغة الكبيرة.
دانييل شيريميت، مهندس ذكاء اصطناعي في مختبر Agentic Lab، قضى شهرًا في محاولة جعل نموذج Gemma 4 يكتب الشعر الروسي بإيقاع وقافية صحيحين. تضمنت خطته الضبط الدقيق باستخدام LoRA، ونظام ناقد ومراجع، والتقييد أثناء التوليد، وتقنيات أخرى. بنى ماسحًا مخصصًا للشعر مستوحى من أداة RPST التي طورها إيليا كوزيريف لتقييم الوزن والقافية. كما جمع مجموعة بيانات من ArsPoetica، وأنشأ 13,342 زوجًا تدريبيًا مع وسوم تحكم. أنتج التشغيل الأول لـ LoRA (الإصدار v1) كلمات غير مفهومة مثل 'нагосты' و'гу́нты' بسبب الإفراط في التكيف واستخدام علامات التشديد في أهداف التدريب التي قسمت الرموز. أنتج التشغيل الثاني (الإصدار v2) مع أهداف نظيفة ومعدل تعلم أقل شعرًا أكثر تماسكًا ولكنه لا يزال معيبًا، وأشار اختبار A/B إلى أنه أفضل من النموذج الأساسي. ومع ذلك، اتضح أن المصحح المستخدم في التقييم كان أعمى: لم يستطع التمييز بين الشعر والنثر، وكل الترتيبات السابقة كانت مجرد ضوضاء. بعد إصلاح المصحح باستخدام مدقق تشديد عصبي (RUAccent)، وتحسين اكتشاف القافية، وإعادة وزن المقاييس، تفوق نموذج Gemma 4 الأساسي على النسختين المضبوطتين بدقة في متوسط الدرجات وأفضل نتيجة من أصل أربع محاولات. قامت النماذج المضبوطة بتحسين الوزن على حساب القافية، وتعلمت بالضبط ما أكدت عليه الوسوم. تسلط القصة الضوء على أهمية التقييم القوي وتجنب مساحات الرموز الغريبة في الضبط الدقيق.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة