Gemma 4'ü İyi Rus Şiiri Yazmaya İkna Etme Çabam Nasıl Başarısız Oldu: Aşırı Uyum ve Kör Metrikler Üzerine Bir Uyarı Hikayesi
Google/DeepMind
Yapay zeka mühendisi Daniil Sheremet, Gemma 4'ü doğru ölçü ve kafiye ile Rusça şiir yazacak şekilde ince ayar yapmak için bir ay harcadı, ancak tüm ince ayarlı sürümler temel modelin altında performans gösterdi. Gerçek suçlu model değil, hatalı bir değerlendirme hattıydı: şiiri düzyazıdan ayırt edemeyen özel bir derecelendirici ve vurgu işaretleriyle ilgili bir tokenizasyon sorunu. Derecelendiriciyi düzelttikten ve uygun A/B testleri yaptıktan sonra temel model kazandı ve bu da büyük dil modeli çıktılarını değerlendirmeyle ilgili kritik bir dersin altını çizdi.
Agentic Lab'de yapay zeka mühendisi olan Daniil Sheremet, bir ayını Gemma 4'ü doğru hece ölçüsü ve kafiye ile Rusça şiir yazdırmaya çalışarak geçirdi. Planı, LoRA ile ince ayar yapmayı, bir eleştirmen-düzeltmen sistemi, kısıtlı kod çözme ve diğer teknikleri içeriyordu. Ilya Kozyrev'in RPST aracından ilham alarak ölçü ve kafiyeyi değerlendirmek için özel bir şiir tarayıcısı geliştirdi. ArsPoetica'dan bir veri seti derledi ve kontrol etiketleriyle 13.342 eğitim çifti oluşturdu. İlk LoRA çalışması (v1), aşırı öğrenme ve eğitim hedeflerinde token'ları parçalayan vurgu işaretlerinin kullanılması nedeniyle 'нагосты' ve 'гу́нты' gibi anlamsız kelimeler üretti. Temiz hedefler ve daha düşük öğrenme oranıyla yapılan ikinci çalışma (v2) daha tutarlı ama yine de kusurlu dizeler üretti ve bir A/B testi, temel modelden daha iyi olduğunu öne sürdü. Ancak değerlendirme puanlayıcısının kör olduğu ortaya çıktı: şiiri düzyazıdan ayırt edemiyordu ve önceki tüm sıralamalar gürültüden ibaretti. Puanlayıcıyı sinirsel bir vurgulayıcı (RUAccent), daha iyi kafiye algılama ve yeniden ağırlıklandırılmış metriklerle düzelttikten sonra, temel Gemma 4 modeli, ortalama ve en iyi-4 puanlarında ince ayarlı her iki modeli de geçti. İnce ayarlı modeller, etiketlerin vurguladığı şeyi tam olarak öğrenerek kafiye pahasına ölçüyü optimize etti. Bu hikaye, sağlam değerlendirmenin önemini ve ince ayarda alışılmadık token alanlarından kaçınmayı vurguluyor.
Kaynak: Habr — хаб ИИ —
orijinal
