모델연구 🇷🇺 13.08.2026 00:05

Gemma 4로 좋은 러시아 시를 쓰는 데 실패한 이야기: 과적합과 맹목적 지표에 대한 경고

Google/DeepMindGoogle/DeepMind
AI 엔지니어 Daniil Sheremet은 한 달 동안 Gemma 4를 미세 조정하여 정확한 운율과 각운을 가진 러시아 시를 작성하려 했지만, 미세 조정된 모든 버전은 기본 모델보다 성능이 떨어졌습니다. 실제 문제는 모델이 아니라 평가 파이프라인에 있었습니다. 시와 산문을 구분하지 못하는 사용자 정의 평가기와 강세 표시의 토큰화 문제였습니다. 평가기를 수정하고 적절한 A/B 테스트를 실행한 후, 기본 모델이 승리했으며, 이는 LLM 출력을 평가할 때 중요한 교훈을 강조합니다.
Agentic Lab의 AI 엔지니어 Daniil Sheremet은 Gemma 4로 적절한 억양 보격과 운율을 가진 러시아 시를 쓰게 하는 데 한 달을 보냈습니다. 그의 계획에는 LoRA를 이용한 미세 조정, 비평가-수정자 시스템, 제한된 디코딩 및 기타 기술이 포함되었습니다. 그는 Ilya Kozyrev의 RPST 도구에서 영감을 받은 맞춤형 시 스캐너를 구축하여 운율과 박자를 평가했습니다. 그는 ArsPoetica에서 데이터 세트를 선별하여 제어 태그가 있는 13,342개의 훈련 쌍을 만들었습니다. 첫 번째 LoRA 실행(v1)은 과적합과 훈련 대상에서 강세 표시의 사용으로 인해 토큰이 분열되어 '나고스티'와 '군티' 같은 무의미한 단어를 생성했습니다. 두 번째 실행(v2)은 깨끗한 대상과 더 낮은 학습률로 더 일관성 있지만 여전히 결함이 있는 시를 생성했으며, A/B 테스트는 기본 모델보다 낫다는 것을 시사했습니다. 그러나 평가 그레이더는 장님이라는 것이 밝혀졌습니다. 시와 산문을 구분하지 못했고, 이전의 모든 순위는 노이즈였습니다. 신경 강세 부여기(RUAccent), 더 나은 운율 감지, 가중치 재조정된 메트릭으로 그레이더를 수정한 후, 기본 Gemma 4 모델은 평균 및 최고 4개 점수에서 두 미세 조정 버전을 모두 이겼습니다. 미세 조정된 모델은 운율을 희생하면서 운율을 최적화했으며, 태그가 강조한 것을 정확히 학습했습니다. 이 이야기는 강력한 평가의 중요성과 미세 조정에서 이국적인 토큰 공간을 피하는 것의 중요성을 강조합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스