PesquisaModelos 🇷🇺 26.07.2026 21:04

Ajuste fino do ruGPT-3 XL 1.3B para o nível de um LLM moderno e comparação com o Gemma3 1B

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
O antigo modelo ruGPT-3 XL 1.3B de 2020 foi ajustado usando os métodos SFT e DPO, transformando-o em um LLM moderno de seguimento de instruções. O resultado foi comparado com o modelo Gemma3 1B de 2025, mostrando que o ruGPT ajustado geralmente supera o Gemma3 em lógica e criatividade, embora tenha dificuldades com instruções negativas e interpretação de papéis.
O modelo ruGPT-3 XL 1.3B, originalmente um modelo pré-treinado de 2020 que só conseguia continuar textos, foi ajustado por meio de SFT (Supervised Fine-Tuning, Ajuste Fino Supervisionado) e DPO (Direct Preference Optimization, Otimização Direta de Preferência) para criar um LLM moderno de seguimento de instruções. Após SFT em um conjunto de dados de 42 milhões de tokens derivado de saiga_preferences, o modelo aprendeu a seguir instruções, responder perguntas e manter diálogos de múltiplas rodadas. Ele foi então comparado com o Gemma3 1B, um modelo de 2025 treinado em 2 trilhões de tokens. O ruGPT ajustado teve melhor desempenho em tarefas como conhecimento de bandas de rock russas, conversas em múltiplas etapas, perguntas de física quântica e um enigma espacial. Ele também lidou com instruções negativas (por exemplo, evitar uma palavra específica) após várias tentativas de regeneração, enquanto o Gemma3 falhou na maioria das tarefas, exceto em role-playing e simulação de terminal, onde o ruGPT teve dificuldades. O DPO melhorou ainda mais o alinhamento, embora o artigo observe que o pequeno conjunto de dados de SFT limitou a generalização.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas