ForschungModelle 🇷🇺 26.07.2026 21:04

Feinabstimmung von ruGPT-3 XL 1.3B auf ein modernes LLM-Niveau und Vergleich mit Gemma3 1B

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
Das alte ruGPT-3 XL 1.3B-Modell aus dem Jahr 2020 wurde mit SFT- und DPO-Methoden nachtrainiert und in ein modernes, instruktionsfolgendes großes Sprachmodell (LLM) verwandelt. Das Ergebnis wurde mit dem Gemma3 1B-Modell von 2025 verglichen, wobei sich zeigte, dass das nachtrainierte ruGPT in Logik und Kreativität oft überlegen ist, jedoch Probleme mit negativen Anweisungen und Rollenspielen hat.
Das ursprüngliche Modell ruGPT-3 XL 1.3B, ein vortrainiertes Modell aus dem Jahr 2020, das lediglich Text fortführen konnte, wurde mithilfe von SFT (Supervised Fine-Tuning) und DPO (Direct Preference Optimization) zu einem modernen, anweisungsbefolgenden LLM verfeinert. Nach dem SFT auf einem 42 Millionen Token umfassenden Datensatz, der aus saiga_preferences abgeleitet wurde, lernte das Modell, Anweisungen zu befolgen, Fragen zu beantworten und mehrzügige Dialoge zu führen. Es wurde dann mit Gemma3 1B verglichen, einem 2025er Modell, das mit 2 Billionen Token trainiert wurde. Das verfeinerte ruGPT schnitt bei Aufgaben wie Wissen über russische Rockbands, mehrschrittige Gespräche, Fragen zur Quantenphysik und einem räumlichen Rätsel besser ab. Es befolgte auch negative Anweisungen (z. B. die Vermeidung eines bestimmten Wortes) nach mehreren Generierungsversuchen, während Gemma3 bei den meisten Aufgaben außer beim Rollenspiel und der Terminalsimulation versagte, wo ruGPT Schwierigkeiten hatte. DPO verbesserte die Ausrichtung weiter, wobei der Artikel anmerkt, dass der kleine SFT-Datensatz die Generalisierung einschränkte.
Quelle: Habr — хаб ML — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten