Wie ich es nicht schaffte, Gemma 4 gute russische Gedichte schreiben zu lassen: Eine warnende Geschichte über Overfitting und blinde Metriken
Google/DeepMind
Der KI-Ingenieur Daniil Sheremet verbrachte einen Monat damit, Gemma 4 zu verfeinern, um russische Gedichte mit korrektem Metrum und Reim zu schreiben, aber alle feinabgestimmten Versionen schnitten schlechter ab als das Basismodell. Der eigentliche Übeltäter war nicht das Modell, sondern eine fehlerhafte Evaluierungspipeline: ein benutzerdefinierter Bewerter, der Poesie nicht von Prosa unterscheiden konnte, plus ein Tokenisierungsproblem mit Betonungszeichen. Nachdem der Bewerter korrigiert und ordnungsgemäße A/B-Tests durchgeführt wurden, gewann das Basismodell, was eine entscheidende Lektion über die Bewertung von LLM-Ausgaben hervorhebt.
Daniil Sheremet, ein KI-Ingenieur bei Agentic Lab, verbrachte einen Monat damit, Gemma 4 dazu zu bringen, russische Gedichte mit korrektem Jambus und Reim zu schreiben. Sein Plan umfasste Feintuning mit LoRA, ein Kritiker-Revisor-System, beschränktes Decoding und andere Techniken. Er baute einen eigenen Gedichtscanner, inspiriert von Ilya Kozyrevs RPST-Tool, um Metrum und Reim zu bewerten. Erstellte einen Datensatz aus ArsPoetica und generierte 13.342 Trainingspaare mit Kontroll-Tags. Der erste LoRA-Lauf (v1) erzeugte Unsinnswörter wie „нагосты“ und „гу́нты“ aufgrund von Überanpassung und der Verwendung von Betonungszeichen in den Trainingszielen, die die Token fragmentierten. Der zweite Lauf (v2) mit sauberen Zielen und niedrigerer Lernrate produzierte kohärentere, aber immer noch fehlerhafte Verse, und ein A/B-Test deutete darauf hin, dass er besser als das Basismodell war. Der Bewertungsgrader stellte sich jedoch als blind heraus: Er konnte Poesie nicht von Prosa unterscheiden, und alle vorherigen Rankings waren Rauschen. Nach der Korrektur des Graders mit einem neuronalen Akzentuator (RUAccent), besserer Reimerkennung und neu gewichteten Metriken übertraf das Basismodell Gemma 4 beide feinabgestimmten Versionen im Durchschnitt und beim Best-of-4-Score. Die feinabgestimmten Modelle optimierten das Metrum auf Kosten des Reims und lernten genau das, was die Tags betonten. Die Geschichte unterstreicht die Bedeutung robuster Bewertung und die Vermeidung exotischer Token-Räume beim Feintuning.
Quelle: Habr — хаб ИИ —
Original
