ModellenOnderzoek 🇷🇺 13.08.2026 00:05

Hoe ik er niet in slaagde Gemma 4 goede Russische poëzie te laten schrijven: een waarschuwend verhaal over overfitting en blinde statistieken

Google/DeepMindGoogle/DeepMind
AI-ingenieur Daniil Sheremet besteedde een maand aan het fijnstellen van Gemma 4 om Russische poëzie te schrijven met correct metrum en rijm, maar alle fijn afgestelde versies presteerden slechter dan het basismodel. De echte boosdoener was niet het model, maar een gebrekkige evaluatiepijplijn: een aangepaste grader die geen onderscheid kon maken tussen poëzie en proza, plus een tokenisatieprobleem met klemtoontekens. Na het repareren van de grader en het uitvoeren van goede A/B-tests won het basismodel, wat een cruciale les benadrukt over het evalueren van LLM-output.
Daniil Sheremet, AI-ingenieur bij Agentic Lab, heeft een maand besteed aan het laten schrijven van Russische poëzie met correcte jambe-metriek en rijm door Gemma 4. Zijn plan omvatte fine-tuning met LoRA, een criticus-revisor-systeem, constrained decoding en andere technieken. Hij bouwde een op maat gemaakte poëziescanner, geïnspireerd door Ilya Kozyrevs RPST-tool, om metrum en rijm te evalueren. Hij stelde een dataset samen van ArsPoetica, waarbij hij 13.342 trainingsparen maakte met controletags. De eerste LoRA-run (v1) produceerde onsamenhangende woorden zoals 'нагосты' en 'гу́нты' als gevolg van overfitting en het gebruik van klemtoontekens in trainingsdoelen die tokens fragmenteerden. De tweede run (v2) met schone doelen en een lager leertempo produceerde coherentere maar nog steeds gebrekkige verzen, en een A/B-test suggereerde dat het beter was dan het basismodel. Echter, de evaluatiegrader bleek blind: het kon poëzie niet van proza onderscheiden, en alle eerdere rangschikkingen waren ruis. Na het repareren van de grader met een neurale accentator (RUAccent), betere rijmdetectie en herwogen metrieken, versloeg het basis-Gemma 4-model beide fijngetunede versies op gemiddelde en beste-van-4-scores. De fijngetunede modellen optimaliseerden het metrum ten koste van het rijm, en leerden precies wat de tags benadrukten. Het verhaal benadrukt het belang van robuuste evaluatie en het vermijden van exotische tokenruimtes bij fine-tuning.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws