ModelosPesquisa 🇷🇺 13.08.2026 00:05

Como Falhei em Fazer a Gemma 4 Escrever Boa Poesia Russa: Um Conto de Advertência sobre Overfitting e Métricas Cegas

Google/DeepMindGoogle/DeepMind
O engenheiro de IA Daniil Sheremet passou um mês ajustando a Gemma 4 para escrever poesia russa com métrica e rima corretas, mas todas as versões ajustadas tiveram desempenho inferior ao modelo base. O verdadeiro culpado não era o modelo, mas um pipeline de avaliação falho: um avaliador personalizado que não conseguia distinguir poesia de prosa, além de um problema de tokenização com marcas de acento tônico. Depois de corrigir o avaliador e executar testes A/B adequados, o modelo base venceu, destacando uma lição crítica sobre a avaliação de saídas de LLMs.
Daniil Sheremet, engenheiro de IA no Agentic Lab, passou um mês tentando fazer o Gemma 4 escrever poesia russa com métrica iâmbica e rimas corretas. Seu plano envolvia fine-tuning com LoRA, um sistema crítico-revisor, decodificação restrita e outras técnicas. Ele construiu um scanner de poesia personalizado, inspirado na ferramenta RPST de Ilya Kozyrev, para avaliar métrica e rima. Ele selecionou um conjunto de dados do ArsPoetica, criando 13.342 pares de treinamento com tags de controle. A primeira execução de LoRA (v1) produziu palavras sem sentido, como 'нагосты' e 'гу́нты', devido ao overfitting e ao uso de marcas de tonicidade nos alvos de treinamento, que fragmentavam os tokens. A segunda execução (v2), com alvos limpos e taxa de aprendizado menor, produziu versos mais coerentes, mas ainda com falhas, e um teste A/B sugeriu que era melhor que o modelo base. No entanto, o avaliador acabou se revelando 'cego': ele não conseguia distinguir poesia de prosa, e todas as classificações anteriores eram ruído. Depois de corrigir o avaliador com um acentuador neural (RUAccent), melhor detecção de rimas e métricas reponderadas, o modelo base Gemma 4 superou ambas as versões com fine-tuning nas pontuações média e melhor-de-4. Os modelos com fine-tuning otimizaram a métrica em detrimento da rima, aprendendo exatamente o que as tags enfatizavam. A história destaca a importância de uma avaliação robusta e de evitar espaços token exóticos no fine-tuning.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas