ArsPoetica, создав 13 342 обучающих пар с управляющими тегами. Первый запуск LoRA (v1) дал бессмысленные слова, такие как «нагосты» и «гу́нты», из-за переобучения и использования знаков ударения в целевых последовательностях, что фрагментировало токены. Второй запуск (v2) с чистыми целями и более низкой скоростью обучения дал более связные, но всё ещё несовершенные стихи, и A/B-тест показал, что он лучше базовой модели. Однако оценщик оказался слепым: он не мог отличить поэзию от прозы, и все предыдущие рейтинги были шумом. После исправления оценщика с помощью нейронного акцентуатора (RUAccent), улучшенного определения рифмы и пересмотренных метрик базовая модель Gemma 4 превзошла обе версии с тонкой настройкой по средним и лучшим из четырёх показателям. Модели с тонкой настройкой оптимизировали метр в ущерб рифме, усваивая именно то, что подчеркивали теги. Эта история подчеркивает важность надежной оценки и избегания экзотического токенного пространства при тонкой настройке.