ModellenOnderzoek 🇺🇸 24.07.2026 05:06

Self-Distilled Reasoning for Fine-Tuning Amazon Nova

Amazon Web ServicesAmazon Web Services
Amazon has introduced the Self-Distilled Reasoning (SDR) method for supervised fine-tuning (SFT) of Amazon Nova 2 models. SDR generates chain-of-thought (CoT) reasoning paths for datasets lacking them, using the model itself. This addresses the problem of reasoning suppression and reduces catastrophic forgetting, improving target performance while retaining general capabilities.
В статье на AWS ML Blog исследована проблема подавления рассуждений при супервизированной тонкой настройке (SFT) моделей на данных без цепочек рассуждений (CoT). При SFT без CoT модель теряет способность рассуждать даже при включённом режиме рассуждения, что приводит к катастрофическому забыванию. Предложен метод Self-Distilled Reasoning (SDR), который на первом этапе генерирует CoT с помощью базовой рассуждающей модели (Amazon Nova 2 Lite), затем дополняет обучающие данные этими трассами и выполняет SFT с включённым режимом рассуждения. Эксперименты на пяти бенчмарках (ToolACE, CoCoHD, GovReport, Invoice-OCR, CaptionGen) показали, что SDR улучшает целевую производительность в среднем на 6,5% по сравнению с простым слиянием моделей, при этом сохраняя математическую точность на уровне 70% против 68% у слияния. SDR не требует ручной аннотации, работает с любыми доменами и эффективнее слияния моделей предотвращает катастрофическое забывание. Метод использует собственную модель как источник рассуждений, что согласуется с принципами само-дистилляции.
Bron: AWS ML blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws