Дообучение ruGPT-3 XL 1.3B до уровня современной LLM и сравнение с Gemma3 1B
Сбербанк
Google/DeepMind
Энтузиаст дообучил pretrain-модель ruGPT-3 XL 1.3B (2020 года) с помощью SFT и DPO до уровня современной LLM. Полученная модель сравнивается с Gemma3 1B 2025 года; во многих тестах ruGPT-3 XL показала более точные и краткие ответы, особенно в задачах на логику и знание российской культуры.
Автор статьи дообучил старую pretrain-модель ruGPT-3 XL 1.3B, выпущенную в 2020-2021 годах, которая изначально умела только продолжать текст. С помощью методов SFT (Supervised Fine-Tuning) и DPO (Direct Preference Optimization) он превратил её в инструкционно-ориентированную LLM. Для SFT использовался датасет IlyaGusev/saiga_preferences (30k записей), обучение заняло около 1,5 часов на одну эпоху
Показать ещё ↓
- Сокращения
- SFT = Supervised Fine-Tuning — контролируемая донастройка
- DPO = Direct Preference Optimization — прямая оптимизация предпочтений
- LLM = Large Language Model — большая языковая модель
- GPT = Generative Pre-trained Transformer — генеративный предобученный трансформер
- RLHF = Reinforcement Learning from Human Feedback — обучение с подкреплением на основе обратной связи от человека
- CoT = Chain-of-Thought — цепочка мыслей
Источник: Habr — хаб ML —
оригинал
