Self-Distilled Reasoning für das Feintuning von Amazon Nova
Amazon Web Services
Amazon untersucht Self-Distilled Reasoning (SDR), um Chain-of-Thought-Spuren für das überwachte Feintuning (Supervised Fine-Tuning, SFT) zu generieren, wenn solche Spuren fehlen. SDR nutzt die eigene Argumentation des zugrunde liegenden Amazon Nova 2 Lite-Modells, mildert katastrophales Vergessen und verbessert die Zielleistung ohne menschliche Annotation.
Beim Feintuning eines Modells mit überwachtem Feintuning (Supervised Fine-Tuning, SFT) ist die Erstellung hochwertiger Kettendenk-Spuren (Chain-of-Thought, CoT) oft unpraktikabel. Ohne Denkspuren kann das Modell aufgrund des Denksuppressionsproblems seine Denkfähigkeit verlieren. Amazon schlägt das selbst-destillierte Denken (Self-Distilled Reasoning, SDR) vor, das das zugrunde liegende Amazon Nova 2 Lite Modell verwendet, um für jedes SFT-Beispiel Denkspuren zu generieren, diese dann den ursprünglichen Ausgaben voranstellt und mit aktiviertem Denkmodus feintuned. SDR erfordert keine menschliche Annotation, ist domänenübergreifend anwendbar und bewahrt die Denkfähigkeit effektiver als Modellzusammenführung. Experimente mit Benchmarks wie ToolACE, CoCoHD, GovReport, Invoice-OCR und CaptionGen zeigen, dass SDR das katastrophale Vergessen abschwächt, die Mathematikleistung aufrechterhält (70 % gegenüber 68 % mit Modellzusammenführung) und die Zielaufgabenleistung um durchschnittlich über 6,5 % verbessert.
Quelle: AWS ML blog —
Original
