Само-дистиллированное рассуждение для тонкой настройки Amazon Nova
Amazon Web Services
Amazon представила метод Self-Distilled Reasoning (SDR) для супервизированной тонкой настройки (SFT) моделей семейства Amazon Nova 2. SDR позволяет генерировать цепочки рассуждений (CoT) для наборов данных без таковых, используя собственную модель. Это решает проблему подавления рассуждений и уменьшает катастрофическое забывание, улучшая целевую производительность и сохраняя общие способности.
В статье на AWS ML Blog исследована проблема подавления рассуждений при супервизированной тонкой настройке (SFT) моделей на данных без цепочек рассуждений (CoT). При SFT без CoT модель теряет способность рассуждать даже при включённом режиме рассуждения, что приводит к катастрофическому забыванию. Предложен метод Self-Distilled Reasoning (SDR), который на первом этапе генерирует CoT с помощью
Показать ещё ↓
- Сокращения
- SFT = Supervised Fine-Tuning — супервизированная тонкая настройка
- CoT = Chain-of-Thought — цепочка рассуждений
- SDR = Self-Distilled Reasoning — само-дистиллированное рассуждение
- RFT = Reinforcement Fine-Tuning — усиливающая тонкая настройка
- LoRA = Low-Rank Adaptation — низкоранговая адаптация
- RLHF = Reinforcement Learning from Human Feedback — обучение с подкреплением на основе человеческой обратной связи
Источник: AWS ML blog —
оригинал
