OnderzoekModellen 🇺🇸 24.07.2026 05:06

Zelfgedistilleerd redeneren voor Amazon Nova Fine-Tuning

Amazon Web ServicesAmazon Web Services
Amazon onderzoekt zelfgedistilleerd redeneren (SDR) om chain-of-thought-sporen te genereren voor supervised fine-tuning (SFT) wanneer dergelijke sporen ontbreken. SDR hergebruikt het eigen redeneren van het basis Amazon Nova 2 Lite-model, waardoor catastrofale vergetelheid wordt beperkt en de doelprestatie verbetert zonder menselijke annotatie.
Bij het finetunen van een model met supervised fine-tuning (SFT) is het vaak onpraktisch om hoogwaardige chain-of-thought (CoT) redeneersporen te creëren. Zonder redeneersporen kan het model zijn redeneervermogen verliezen vanwege het redeneeronderdrukkingsprobleem. Amazon stelt Self-Distilled Reasoning (SDR) voor, waarbij het basis Amazon Nova 2 Lite-model wordt gebruikt om voor elk SFT-voorbeeld redeneersporen te genereren, die vervolgens aan de oorspronkelijke uitvoer worden toegevoegd en waarna het model wordt finetuned met redeneermodus. SDR vereist geen menselijke annotatie, is toepasbaar in verschillende domeinen en behoudt het redeneervermogen effectiever dan modelmerging. Experimenten met benchmarks zoals ToolACE, CoCoHD, GovReport, Invoice-OCR en CaptionGen tonen aan dat SDR catastrofaal vergeten vermindert, wiskundige prestaties behoudt (70% versus 68% met modelmerging) en de doelprestaties gemiddeld met meer dan 6,5% verbetert.
Bron: AWS ML blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws