ruGPT-3 XL 1.3B 모델을 현대 LLM 수준으로 미세 조정하고 Gemma3 1B와 비교
Сбербанк
Google/DeepMind
2020년의 고 ruGPT-3 XL 1.3B 모델을 SFT 및 DPO 방법을 사용하여 미세 조정하여 현대적인 명령 수행 LLM으로 변환했습니다. 그 결과를 2025년 Gemma3 1B 모델과 비교했으며, 미세 조정된 ruGPT가 논리와 창의성에서 종종 Gemma3를 능가하지만, 부정 명령과 역할극에서는 어려움을 겪는 것으로 나타났습니다.
ruGPT-3 XL 1.3B 모델은 2020년에 텍스트만 이어서 생성할 수 있었던 사전 훈련 모델로, SFT(지도 미세 조정)와 DPO(직접 선호 최적화)를 사용하여 미세 조정되어 현대적인 명령 수행 LLM으로 만들어졌습니다. saiga_preferences에서 파생된 4200만 토큰 데이터셋으로 SFT를 수행한 후, 모델은 명령을 따르고 질문에 답하며 다중 턴 대화를 유지하는 방법을 학습했습니다. 그런 다음 2조 토큰으로 훈련된 2025년 모델인 Gemma3 1B와 비교되었습니다. 미세 조정된 ruGPT는 러시아 록 밴드 지식, 다단계 대화, 양자 물리학 질문, 공간적 수수께끼와 같은 작업에서 더 나은 성능을 보였습니다. 또한 여러 번의 재생성 시도 후에 특정 단어 회피와 같은 부정 명령도 처리했지만, Gemma3는 롤플레잉과 터미널 시뮬레이션(ruGPT가 어려워한 작업)을 제외한 대부분의 작업에서 실패했습니다. DPO는 정렬을 더욱 개선했지만, 기사에서는 작은 SFT 데이터셋이 일반화를 제한했다고 언급합니다.
출처: Habr — хаб ML —
원문
