Тонкая настройка ruGPT-3 XL 1.3B до уровня современной LLM и сравнение с Gemma3 1B
Сбербанк
Google/DeepMind
Древняя модель ruGPT-3 XL 1.3B 2020 года была дообучена с использованием методов SFT и DPO, превратившись в современную LLM, следующую инструкциям. Результат сравнили с моделью Gemma3 1B 2025 года, показав, что дообученная ruGPT часто превосходит Gemma3 в логике и креативности, хотя испытывает трудности с негативными инструкциями и ролевыми играми.
Модель ruGPT-3 XL 1.3B, изначально предобученная модель 2020 года, способная только продолжать текст, была дообучена с использованием SFT (Supervised Fine-Tuning, контролируемая тонкая настройка) и DPO (Direct Preference Optimization, прямая оптимизация предпочтений) для создания современной LLM (large language model, большая языковая модель), следующей инструкциям. После SFT на датасете из 42
Показать ещё ↓
Источник: Habr — хаб ML —
оригинал
