RisetModel 🇷🇺 26.07.2026 21:04

Fine-tuning ruGPT-3 XL 1.3B ke Level LLM Modern dan Perbandingan dengan Gemma3 1B

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
Model kuno ruGPT-3 XL 1.3B dari tahun 2020 di-fine-tuning menggunakan metode SFT dan DPO, mengubahnya menjadi LLM instruksi-mengikuti modern. Hasilnya dibandingkan dengan model Gemma3 1B tahun 2025, menunjukkan bahwa ruGPT yang di-fine-tuning sering mengungguli Gemma3 dalam logika dan kreativitas, meskipun kesulitan dengan instruksi negatif dan role-playing.
Model ruGPT-3 XL 1.3B, yang awalnya merupakan model pretrain dari tahun 2020 dan hanya bisa melanjutkan teks, di-fine-tune menggunakan SFT (Supervised Fine-Tuning) dan DPO (Direct Preference Optimization) untuk menjadi LLM modern yang mampu mengikuti instruksi. Setelah SFT pada dataset 42 juta token yang berasal dari saiga_preferences, model tersebut belajar mengikuti instruksi, menjawab pertanyaan, dan mempertahankan dialog multi-putaran. Model ini kemudian dibandingkan dengan Gemma3 1B, model tahun 2025 yang dilatih pada 2 triliun token. ruGPT yang telah di-fine-tune menunjukkan kinerja lebih baik pada tugas-tugas seperti pengetahuan tentang band rock Rusia, percakapan multi-langkah, pertanyaan fisika kuantum, dan teka-teki spasial. Model ini juga menangani instruksi negatif (misalnya, menghindari kata tertentu) setelah beberapa kali percobaan regenerasi, sementara Gemma3 gagal pada sebagian besar tugas kecuali bermain peran dan simulasi terminal, di mana ruGPT kesulitan. DPO lebih lanjut meningkatkan alignment, meskipun artikel mencatat bahwa dataset SFT yang kecil membatasi generalisasi.
Sumber: Habr — хаб ML — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru