Comment j'ai échoué à faire écrire de la bonne poésie russe à Gemma 4 : un récit édifiant sur le sur-apprentissage et les métriques aveugles
Google/DeepMind
L'ingénieur en IA Daniil Sheremet a passé un mois à affiner Gemma 4 pour écrire de la poésie russe avec un mètre et des rimes corrects, mais toutes les versions affinées ont sous-performé le modèle de base. Le vrai coupable n'était pas le modèle mais un pipeline d'évaluation défectueux : un correcteur personnalisé qui ne pouvait pas distinguer la poésie de la prose, plus un problème de tokenisation avec les marques d'accent. Après avoir corrigé le correcteur et effectué des tests A/B appropriés, le modèle de base a gagné, soulignant une leçon cruciale sur l'évaluation des sorties des modèles de langage.
Daniil Sheremet, ingénieur IA chez Agentic Lab, a passé un mois à essayer de faire écrire à Gemma 4 de la poésie russe avec un mètre iambique et des rimes correctes. Son plan impliquait un fine-tuning avec LoRA, un système critique-réviseur, un décodage contraint, et d'autres techniques. Il a construit un scanner de poésie personnalisé inspiré de l'outil RPST d'Ilya Kozyrev pour évaluer le mètre et les rimes. Il a constitué un jeu de données à partir d'ArsPoetica, créant 13 342 paires d'entraînement avec des balises de contrôle. La première exécution LoRA (v1) a produit des mots incohérents comme "нагосты" et "гу́нты" en raison du surapprentissage et de l'utilisation de marques d'accentuation dans les cibles d'entraînement qui fragmentaient les tokens. La deuxième exécution (v2) avec des cibles propres et un taux d'apprentissage plus faible a produit des vers plus cohérents mais toujours imparfaits, et un test A/B suggérait qu'elle était meilleure que le modèle de base. Cependant, le module d'évaluation s'est avéré aveugle : il ne pouvait pas distinguer la poésie de la prose, et tous les classements précédents n'étaient que du bruit. Après avoir corrigé le module avec un accenteur neuronal (RUAccent), une meilleure détection des rimes et des métriques repondérées, le modèle de base Gemma 4 a surpassé les deux versions affinées en termes de scores moyens et de meilleur sur 4. Les modèles affinés ont optimisé le mètre au détriment des rimes, apprenant exactement ce que les balises mettaient en avant. Cette histoire souligne l'importance d'une évaluation robuste et d'éviter les espaces de tokens exotiques lors du fine-tuning.
Source: Habr — хаб ИИ —
original
