RisetModel 🇺🇸 24.07.2026 05:06

Penalaran melalui Self-Distilled untuk Fine-Tuning Amazon Nova

Amazon Web ServicesAmazon Web Services
Amazon mengeksplorasi penalaran self-distilled (SDR) untuk menghasilkan jejak rantai pemikiran bagi fine-tuning terawasi (SFT) ketika jejak tersebut tidak tersedia. SDR menggunakan kembali penalaran model dasar Amazon Nova 2 Lite, mengurangi pelupa katastrofik dan meningkatkan performa target tanpa anotasi manusia.
Ketika melakukan fine-tuning model dengan supervised fine-tuning (SFT), seringkali tidak praktis untuk membuat rantai pemikiran (chain-of-thought, CoT) yang berkualitas tinggi. Tanpa jejak penalaran, model dapat kehilangan kemampuan penalarannya karena masalah penekanan penalaran (reasoning suppression). Amazon mengusulkan Self-Distilled Reasoning (SDR), yang menggunakan model dasar Amazon Nova 2 Lite untuk menghasilkan jejak penalaran bagi setiap contoh SFT, kemudian menambahkannya di depan output asli dan melakukan fine-tuning dengan mode penalaran. SDR tidak memerlukan anotasi manusia, dapat diterapkan di berbagai domain, dan mempertahankan kemampuan penalaran lebih efektif dibandingkan penggabungan model (model merging). Eksperimen pada tolok ukur seperti ToolACE, CoCoHD, GovReport, Invoice-OCR, dan CaptionGen menunjukkan bahwa SDR mengurangi lupa bencana (catastrophic forgetting), mempertahankan performa matematika (70% dibanding 68% dengan penggabungan model), dan meningkatkan performa target rata-rata lebih dari 6,5%.
Sumber: AWS ML blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru