Raisonnement auto-distillé pour le réglage fin d'Amazon Nova
Amazon Web Services
Amazon explore le raisonnement auto-distillé (self-distilled reasoning, SDR) pour générer des traces de chaîne de pensée (chain-of-thought) nécessaires au réglage fin supervisé (supervised fine-tuning, SFT) lorsque ces traces sont absentes. Le SDR réutilise le propre raisonnement du modèle de base Amazon Nova 2 Lite, atténuant l'oubli catastrophique et améliorant les performances cibles sans annotation humaine.
Lors du réglage fin d'un modèle avec l'apprentissage supervisé fin (Supervised Fine-Tuning, SFT), la création de traces de raisonnement de haute qualité par chaîne de pensée (Chain-of-Thought, CoT) est souvent peu pratique. Sans traces de raisonnement, le modèle peut perdre ses capacités de raisonnement en raison du problème de suppression du raisonnement. Amazon propose le raisonnement autodistillé (Self-Distilled Reasoning, SDR), qui utilise le modèle de base Amazon Nova 2 Lite pour générer des traces de raisonnement pour chaque exemple SFT, puis les ajoute au début des sorties originales et effectue un réglage fin en mode raisonnement. Le SDR ne nécessite aucune annotation humaine, est applicable à tous les domaines et préserve les capacités de raisonnement plus efficacement que la fusion de modèles. Des expériences sur des références telles que ToolACE, CoCoHD, GovReport, Invoice-OCR et CaptionGen montrent que le SDR atténue l'oubli catastrophique, maintient les performances en mathématiques (70 % contre 68 % avec la fusion de modèles) et améliore les performances cibles de plus de 6,5 % en moyenne.
Source: AWS ML blog —
original
