Cómo fallé al intentar que Gemma 4 escribiera buena poesía rusa: una historia de advertencia sobre sobreajuste y métricas ciegas
Google/DeepMind
El ingeniero de IA Daniil Sheremet pasó un mes ajustando Gemma 4 para escribir poesía rusa con métrica y rima correctas, pero todas las versiones ajustadas tuvieron un rendimiento inferior al modelo base. El verdadero culpable no fue el modelo, sino un proceso de evaluación defectuoso: un calificador personalizado que no podía distinguir poesía de prosa, además de un problema de tokenización con las marcas de acento. Tras corregir el calificador y realizar pruebas A/B adecuadas, el modelo base ganó, lo que resalta una lección crucial sobre la evaluación de resultados de los modelos de lenguaje.
Daniil Sheremet, ingeniero de IA en Agentic Lab, pasó un mes intentando que Gemma 4 escribiera poesía rusa con métrica yámbica y rima adecuadas. Su plan implicaba ajuste fino con LoRA, un sistema crítico-revisor, decodificación restringida y otras técnicas. Construyó un escáner de poesía personalizado inspirado en la herramienta RPST de Ilya Kozyrev para evaluar métrica y rima. Creó un conjunto de datos de ArsPoetica, generando 13.342 pares de entrenamiento con etiquetas de control. La primera ejecución de LoRA (v1) produjo palabras sin sentido como 'нагосты' y 'гу́нты' debido al sobreajuste y al uso de marcas de acentuación en los objetivos de entrenamiento que fragmentaban los tokens. La segunda ejecución (v2) con objetivos limpios y una tasa de aprendizaje más baja produjo versos más coherentes pero aún imperfectos, y una prueba A/B sugirió que era mejor que el modelo base. Sin embargo, el evaluador resultó ser ciego: no podía distinguir poesía de prosa, y todas las clasificaciones anteriores eran ruido. Después de arreglar el evaluador con un acentuador neuronal (RUAccent), una mejor detección de rimas y métricas reponderadas, el modelo base Gemma 4 superó a ambas versiones ajustadas en las puntuaciones promedio y de mejor de 4. Los modelos ajustados optimizaron la métrica a expensas de la rima, aprendiendo exactamente lo que las etiquetas enfatizaban. La historia destaca la importancia de una evaluación robusta y de evitar espacios de tokens exóticos en el ajuste fino.
Fuente: Habr — хаб ИИ —
original
