AraştırmaModeller 🇷🇺 26.07.2026 21:04

ruGPT-3 XL 1.3B Modelini Modern Bir LLM Seviyesine İnce Ayar Yapma ve Gemma3 1B ile Karşılaştırma

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
2020 tarihli eski ruGPT-3 XL 1.3B modeli, SFT (Denetimli İnce Ayar) ve DPO (Doğrudan Tercih Optimizasyonu) yöntemleri kullanılarak ince ayar yapıldı ve modern bir talimat takip eden LLM (Büyük Dil Modeli) haline getirildi. Sonuç, 2025 tarihli Gemma3 1B modeliyle karşılaştırıldı; ince ayarlı ruGPT'nin mantık ve yaratıcılık açısından genellikle Gemma3'ten daha iyi performans gösterdiği, ancak olumsuz talimatlar ve rol yapma konusunda zorlandığı görüldü.
ruGPT-3 XL 1.3B modeli, 2020'den kalma ve yalnızca metni devam ettirebilen bir ön eğitim modeliyken, modern bir talimat takip eden LLM oluşturmak için SFT (Denetimli İnce Ayar) ve DPO (Doğrudan Tercih Optimizasyonu) kullanılarak ince ayar yapıldı. saiga_preferences'tan türetilen 42M tokenlik bir veri kümesinde SFT uygulandıktan sonra model, talimatları izlemeyi, soruları yanıtlamayı ve çok turlu diyalogları sürdürmeyi öğrendi. Ardından, 2T token üzerinde eğitilmiş 2025 modeli Gemma3 1B ile karşılaştırıldı. İnce ayarlı ruGPT, Rus rock grupları bilgisi, çok adımlı konuşmalar, kuantum fiziği soruları ve uzamsal bir bilmece gibi görevlerde daha iyi performans gösterdi. Ayrıca, birkaç yeniden oluşturma denemesinden sonra olumsuz talimatları (örneğin, belirli bir kelimeden kaçınma) ele alabildi; oysa Gemma3, ruGPT'nin zorlandığı rol yapma ve terminal simülasyonu dışındaki çoğu görevde başarısız oldu. DPO, uyumu daha da iyileştirdi, ancak makale, küçük SFT veri kümesinin genellemeyi sınırladığını belirtiyor.
Kaynak: Habr — хаб ML — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler