ModelosInvestigación 🇷🇺 26.07.2026 21:04

Ajuste fino de ruGPT-3 XL 1.3B al nivel de LLM moderno y comparación con Gemma3 1B

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
Un aficionado ajustó el modelo preentrenado ruGPT-3 XL 1.3B (de 2020) utilizando entrenamiento supervisado fino y optimización de preferencias directas hasta alcanzar el nivel de los LLM modernos. El modelo resultante se compara con Gemma3 1B de 2025; en muchas pruebas, ruGPT-3 XL mostró respuestas más precisas y concisas, especialmente en tareas de lógica y conocimiento de la cultura rusa.
El autor del artículo afinó un modelo preentrenado antiguo, ruGPT-3 XL 1.3B, lanzado en 2020-2021, que originalmente solo podía continuar texto. Mediante los métodos de Supervised Fine-Tuning (SFT) y Direct Preference Optimization (DPO), lo transformó en un modelo de lenguaje grande (LLM) orientado a instrucciones. Para SFT se utilizó el conjunto de datos IlyaGusev/saiga_preferences (30 mil registros), y el entrenamiento tomó alrededor de 1,5 horas por época con SFTTrainer de Hugging Face. Tras el ajuste fino, el modelo aprendió a entender preguntas, dar respuestas correctas, seguir la plantilla de diálogo y finalizar la generación con el token EOS. El autor también realizó una comparación con el modelo moderno Gemma3 1B (de 2025), entrenado con 2 billones de tokens. En pruebas sobre conocimiento de grupos de rock rusos, diálogos de múltiples turnos, preguntas complejas de física, acertijos y respuestas breves, ruGPT-3 XL mostró resultados mejores o comparables, aunque en algunas tareas, como la simulación de un terminal Linux, Gemma3 1B funcionó mejor. También se señala que el modelo puede usar cadenas de razonamiento (Chain-of-Thought, CoT) para mejorar la calidad de las respuestas. Después del ajuste fino, el modelo se convirtió al formato GGUF para su uso conveniente en llama.cpp.
Fuente: Habr — хаб ML — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas