研究模型 🇺🇸 24.07.2026 05:06

Amazon Nova 微调中的自蒸馏推理

Amazon Web ServicesAmazon Web Services
Amazon 探索自蒸馏推理(SDR)方法,在链式思维轨迹缺失时,为监督微调(SFT)生成此类轨迹。SDR 复用基础 Amazon Nova 2 Lite 模型自身的推理能力,减轻灾难性遗忘并在无需人工标注的情况下提升目标性能。
在使用监督式微调(SFT)对模型进行微调时,创建高质量的思路链(CoT)推理轨迹往往不切实际。缺乏推理轨迹会导致模型因推理抑制问题而丧失推理能力。亚马逊提出了自蒸馏推理(SDR)方法,该方法利用基础模型 Amazon Nova 2 Lite 为每个 SFT 示例生成推理轨迹,然后将其附加到原始输出之前,并以推理模式进行微调。SDR 无需人工标注,可跨领域应用,并且比模型合并能更有效地保留推理能力。在 ToolACE、CoCoHD、GovReport、Invoice-OCR 和 CaptionGen 等基准测试上的实验表明,SDR 能够缓解灾难性遗忘,维持数学性能(70% 对比模型合并的 68%),并将目标性能平均提升超过 6.5%。
来源: AWS ML blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻