Fine-tuning de ruGPT-3 XL 1.3B a un nivel de LLM moderno y comparación con Gemma3 1B
Сбербанк
Google/DeepMind
El antiguo modelo ruGPT-3 XL 1.3B de 2020 fue afinado mediante los métodos SFT y DPO, transformándolo en un LLM moderno de seguimiento de instrucciones. El resultado se comparó con el modelo Gemma3 1B de 2025, mostrando que el ruGPT afinado a menudo supera a Gemma3 en lógica y creatividad, aunque tiene dificultades con instrucciones negativas y juegos de rol.
El modelo ruGPT-3 XL 1.3B, originalmente un modelo preentrenado de 2020 que solo podía continuar texto, fue ajustado mediante SFT (Supervised Fine-Tuning, ajuste fino supervisado) y DPO (Direct Preference Optimization, optimización directa de preferencias) para crear un LLM moderno capaz de seguir instrucciones. Después del SFT en un conjunto de datos de 42 millones de tokens derivado de saiga_preferences, el modelo aprendió a seguir instrucciones, responder preguntas y mantener diálogos de múltiples turnos. Luego se comparó con Gemma3 1B, un modelo de 2025 entrenado con 2 billones de tokens. El ruGPT ajustado tuvo un mejor rendimiento en tareas como conocimiento de bandas de rock rusas, conversaciones de múltiples pasos, preguntas de física cuántica y un acertijo espacial. También manejó instrucciones negativas (por ejemplo, evitar una palabra específica) tras varios intentos de regeneración, mientras que Gemma3 falló en la mayoría de las tareas, excepto en juegos de roles y simulación de terminal, donde ruGPT tuvo dificultades. El DPO mejoró aún más la alineación, aunque el artículo señala que el pequeño conjunto de datos de SFT limitó la generalización.
Fuente: Habr — хаб ML —
original
