ModèlesRecherche 🇺🇸 24.07.2026 05:06

Auto-Distillation du Raisonnement pour le Fine-Tuning d'Amazon Nova

Amazon Web ServicesAmazon Web Services
Amazon a introduit la méthode d'Auto-Distillation du Raisonnement (SDR) pour le fine-tuning supervisé (SFT) des modèles Amazon Nova 2. SDR génère des chemins de raisonnement de chaîne de pensée (CoT) pour les ensembles de données qui en sont dépourvus, en utilisant le modèle lui-même. Cela résout le problème de la suppression du raisonnement et réduit l'oubli catastrophique, améliorant ainsi les performances cibles tout en conservant les capacités générales.
Dans un article du blog AWS ML, les auteurs explorent le problème de la suppression du raisonnement lors du fine-tuning supervisé (SFT) de modèles sur des données sans chaînes de raisonnement (CoT). Lorsque le SFT est effectué sans CoT, le modèle perd sa capacité à raisonner, même lorsque le mode raisonnement est activé, ce qui conduit à un oubli catastrophique. La méthode proposée, appelée Self-Distilled Reasoning (SDR), consiste d'abord à générer des CoT à l'aide d'un modèle de raisonnement de base (Amazon Nova 2 Lite), puis à enrichir les données d'entraînement avec ces traces et à effectuer un SFT en mode raisonnement activé. Des expériences sur cinq benchmarks (ToolACE, CoCoHD, GovReport, Invoice-OCR, CaptionGen) montrent que SDR améliore la performance cible en moyenne de 6,5 % par rapport à une simple fusion de modèles, tout en maintenant une précision mathématique de 70 % contre 68 % pour la fusion. SDR ne nécessite pas d'annotation manuelle, fonctionne dans tous les domaines et prévient plus efficacement l'oubli catastrophique que la fusion de modèles. La méthode utilise le modèle lui-même comme source de raisonnement, ce qui est cohérent avec les principes de l'auto-distillation.
Source: AWS ML blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches