自蒸馏推理方法用于微调Amazon Nova模型
Amazon Web Services
亚马逊推出了自蒸馏推理(SDR)方法,用于对Amazon Nova 2模型进行监督微调(SFT)。SDR利用模型自身为缺乏思维链(CoT)推理路径的数据集生成推理路径,从而解决推理抑制问题并减少灾难性遗忘,在提升目标任务性能的同时保持通用能力。
在AWS ML博客的一篇文章中,探讨了监督微调(SFT)模型在无推理链(CoT)数据上导致的推理抑制问题。无CoT的SFT会使模型即使在启用推理模式时也丧失推理能力,引发灾难性遗忘。为此,提出了一种自蒸馏推理方法(SDR):首先生成CoT轨迹(使用基础推理模型Amazon Nova 2 Lite),然后用这些轨迹扩充训练数据,最后在启用推理模式的情况下进行SFT。在五个基准测试(ToolACE、CoCoHD、GovReport、Invoice-OCR、CaptionGen)上的实验表明,与简单的模型融合相比,SDR平均提升目标性能6.5%,同时数学准确率保持70%(融合为68%)。SDR无需人工标注,适用于任何领域,并且比模型融合更有效地防止灾难性遗忘。该方法使用自身模型作为推理源,符合自蒸馏原理。
来源: AWS ML blog —
原文
