ModelleForschung 🇺🇸 24.07.2026 05:06

Self-Distilled Reasoning für das Feintuning von Amazon Nova

Amazon Web ServicesAmazon Web Services
Amazon hat die Self-Distilled Reasoning (SDR)-Methode für das überwachte Feintuning (Supervised Fine-Tuning, SFT) der Amazon Nova 2 Modelle eingeführt. SDR generiert Chain-of-Thought (CoT)-Denkpfade für Datensätze, die diese nicht enthalten, und nutzt dabei das Modell selbst. Dies adressiert das Problem der Denkunterdrückung und reduziert katastrophales Vergessen, wodurch die Zielleistung verbessert wird, während allgemeine Fähigkeiten erhalten bleiben.
Ein Artikel im AWS ML Blog untersucht das Problem des Reasoning-Overwritings bei supervidierter Feinabstimmung (SFT) von Modellen auf Daten ohne Reasoning Chains (CoT). Bei SFT ohne CoT verliert das Modell die Fähigkeit zum logischen Schlussfolgern, selbst wenn der Reasoning-Modus aktiviert ist, was zu katastrophalem Vergessen führt. Vorgeschlagen wird die Methode des Self-Distilled Reasoning (SDR), die in der ersten Phase mittels eines grundlegenden Reasoning-Modells (Amazon Nova 2 Lite) CoT generiert, dann die Trainingsdaten mit diesen Spuren anreichert und eine SFT mit aktiviertem Reasoning-Modus durchführt. Experimente auf fünf Benchmarks (ToolACE, CoCoHD, GovReport, Invoice-OCR, CaptionGen) zeigen, dass SDR die Zielperformance im Durchschnitt um 6,5 % gegenüber einfachem Modell-Merging verbessert, während die mathematische Genauigkeit bei 70 % im Vergleich zu 68 % bei Merging erhalten bleibt. SDR erfordert keine manuelle Annotation, ist für beliebige Domänen geeignet und verhindert katastrophales Vergessen effektiver als Modell-Merging. Die Methode verwendet das eigene Modell als Reasoning-Quelle, was mit den Prinzipien der Selbst-Destillation übereinstimmt.
Quelle: AWS ML blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten