Kisah Saya Gagal Membuat Gemma 4 Menulis Puisi Rusia yang Bagus: Pelajaran tentang Overfitting dan Metrik yang Buta
Google/DeepMind
Insinyur AI Daniil Sheremet menghabiskan waktu sebulan untuk menyetel Gemma 4 agar dapat menulis puisi Rusia dengan meter dan rima yang benar, tetapi semua versi yang disetel kinerjanya lebih buruk daripada model dasar. Penyebab sebenarnya bukan modelnya, melainkan jalur evaluasi yang cacat: penilai kustom yang tidak dapat membedakan puisi dari prosa, serta masalah tokenisasi dengan tanda tekanan. Setelah memperbaiki penilai dan menjalankan uji A/B yang tepat, model dasar menang, menyoroti pelajaran penting tentang evaluasi keluaran model bahasa besar (LLM).
Daniil Sheremet, seorang insinyur AI di Agentic Lab, menghabiskan waktu satu bulan untuk mencoba membuat Gemma 4 menulis puisi Rusia dengan iambik dan rima yang tepat. Rencananya melibatkan fine-tuning dengan LoRA, sistem kritik-revisi, decoding terkendala, dan teknik lainnya. Ia membangun pemindai puisi khusus yang terinspirasi oleh alat RPST milik Ilya Kozyrev untuk mengevaluasi meter dan rima. Ia mengkurasi dataset dari ArsPoetica, menciptakan 13.342 pasangan pelatihan dengan tag kontrol. Percobaan LoRA pertama (v1) menghasilkan kata-kata tidak jelas seperti 'нагосты' dan 'гу́нты' karena overfitting dan penggunaan tanda stres pada target pelatihan yang memecah token. Percobaan kedua (v2) dengan target bersih dan tingkat pembelajaran yang lebih rendah menghasilkan syair yang lebih koheren namun masih cacat, dan uji A/B menunjukkan bahwa itu lebih baik daripada model dasar. Namun, penilai evaluasi ternyata buta: ia tidak dapat membedakan puisi dari prosa, dan semua peringkat sebelumnya hanyalah noise. Setelah memperbaiki penilai dengan aksentuator saraf (RUAccent), deteksi rima yang lebih baik, dan metrik yang diberi bobot ulang, model Gemma 4 dasar mengungguli kedua versi fine-tuning pada skor rata-rata dan terbaik-dari-4. Model fine-tuning mengoptimalkan meter dengan mengorbankan rima, mempelajari persis apa yang ditekankan oleh tag. Kisah ini menyoroti pentingnya evaluasi yang kuat dan menghindari ruang token yang eksotis dalam fine-tuning.
Sumber: Habr — хаб ИИ —
asli
