базовой рассуждающей модели (Amazon Nova 2 Lite), затем дополняет обучающие данные этими трассами и выполняет SFT с включённым режимом рассуждения. Эксперименты на пяти бенчмарках (ToolACE, CoCoHD, GovReport, Invoice-OCR, CaptionGen) показали, что SDR улучшает целевую производительность в среднем на 6,5% по сравнению с простым слиянием моделей, при этом сохраняя математическую точность на уровне 70% против 68% у слияния. SDR не требует ручной аннотации, работает с любыми доменами и эффективнее слияния моделей предотвращает катастрофическое забывание. Метод использует собственную модель как источник рассуждений, что согласуется с принципами само-дистилляции.