MallitTutkimus 🇺🇸 24.07.2026 05:06

Self-Distilled Reasoning Amazon Nova -mallien hienosäätöön

Amazon Web ServicesAmazon Web Services
Amazon on esitellyt Self-Distilled Reasoning (SDR) -menetelmän Amazon Nova 2 -mallien ohjattuun hienosäätöön (SFT). SDR luo päättelyketjuja (CoT) niitä vailla oleville tietojoukoille käyttämällä itse mallia. Tämä ratkaisee päättelyn tukahduttamisen ongelman ja vähentää katastrofaalista unohtamista, parantaen kohdesuorituskykyä säilyttäen samalla yleiset kyvyt.
В статье на AWS ML Blog исследована проблема подавления рассуждений при супервизированной тонкой настройке (SFT) моделей на данных без цепочек рассуждений (CoT). При SFT без CoT модель теряет способность рассуждать даже при включённом режиме рассуждения, что приводит к катастрофическому забыванию. Предложен метод Self-Distilled Reasoning (SDR), который на первом этапе генерирует CoT с помощью базовой рассуждающей модели (Amazon Nova 2 Lite), затем дополняет обучающие данные этими трассами и выполняет SFT с включённым режимом рассуждения. Эксперименты на пяти бенчмарках (ToolACE, CoCoHD, GovReport, Invoice-OCR, CaptionGen) показали, что SDR улучшает целевую производительность в среднем на 6,5% по сравнению с простым слиянием моделей, при этом сохраняя математическую точность на уровне 70% против 68% у слияния. SDR не требует ручной аннотации, работает с любыми доменами и эффективнее слияния моделей предотвращает катастрофическое забывание. Метод использует собственную модель как источник рассуждений, что согласуется с принципами само-дистилляции.
Lähde: AWS ML blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset