ModelleForschung 🇷🇺 26.07.2026 21:04

Feinabstimmung von ruGPT-3 XL 1.3B auf modernes LLM-Niveau und Vergleich mit Gemma3 1B

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
Ein Enthusiast hat das vortrainierte Modell ruGPT-3 XL 1.3B (von 2020) mittels SFT und DPO auf modernes LLM-Niveau feinabgestimmt. Das resultierende Modell wird mit Gemma3 1B von 2025 verglichen; in vielen Tests zeigte ruGPT-3 XL präzisere und knappere Antworten, insbesondere bei Logikaufgaben und Kenntnissen der russischen Kultur.
Der Autor des Artikels hat ein altes vortrainiertes Modell, ruGPT-3 XL 1.3B, das zwischen 2020 und 2021 veröffentlicht wurde und ursprünglich nur Text fortsetzen konnte, nachtrainiert. Mit Methoden des Supervised Fine-Tunings (SFT) und der Direct Preference Optimization (DPO) verwandelte er es in eine befehlsorientierte Large Language Model (LLM). Für das SFT wurde der Datensatz IlyaGusev/saiga_preferences (30.000 Einträge) verwendet; das Training dauerte mit Hilfe des SFTTrainer von Hugging Face etwa 1,5 Stunden pro Epoche. Nach dem Feintuning lernte das Modell, Fragen zu verstehen, korrekte Antworten zu geben, die Dialogvorlage einzuhalten und die Generierung mit dem EOS-Token zu beenden. Der Autor führte auch einen Vergleich mit dem modernen Modell Gemma3 1B (2025) durch, das auf zwei Billionen Token trainiert wurde. In Tests zu russischen Rockbands, mehrstufigen Dialogen, komplexen Physikfragen, Rätseln und kurzen Antworten zeigte ruGPT-3 XL bessere oder vergleichbare Ergebnisse, obwohl Gemma3 1B bei einigen Aufgaben, wie der Nachahmung eines Linux-Terminals, besser abschnitt. Zudem wird angemerkt, dass das Modell eine Chain-of-Thought (CoT) verwenden kann, um die Antwortqualität zu verbessern. Nach dem Feintuning wurde das Modell in das GGUF-Format konvertiert, um es bequem in llama.cpp verwenden zu können.
Quelle: Habr — хаб ML — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten