InvestigaciónModelos 🇺🇸 24.07.2026 05:06

Razonamiento Autodestilado para el Ajuste Fino de Amazon Nova

Amazon Web ServicesAmazon Web Services
Amazon explora el razonamiento autodestilado (SDR) para generar trazas de cadena de pensamiento para el ajuste fino supervisado cuando dichas trazas faltan. SDR reutiliza el razonamiento propio del modelo base Amazon Nova 2 Lite, mitigando el olvido catastrófico y mejorando el rendimiento objetivo sin anotación humana.
Al ajustar un modelo con fine-tuning supervisado (SFT, por sus siglas en inglés), crear cadenas de razonamiento (CoT, por sus siglas en inglés) de alta calidad suele ser poco práctico. Sin estas cadenas, el modelo puede perder su capacidad de razonamiento debido al problema de supresión del razonamiento. Amazon propone Self-Distilled Reasoning (SDR), que utiliza el modelo base Amazon Nova 2 Lite para generar cadenas de razonamiento para cada ejemplo de SFT, las antepone a las salidas originales y realiza el fine-tuning con el modo de razonamiento activado. SDR no requiere anotación humana, es aplicable en múltiples dominios y preserva la capacidad de razonamiento de manera más efectiva que la fusión de modelos. Experimentos en benchmarks como ToolACE, CoCoHD, GovReport, Invoice-OCR y CaptionGen muestran que SDR mitiga el olvido catastrófico, mantiene el rendimiento en matemáticas (70% frente al 68% con fusión de modelos) y mejora el rendimiento objetivo en más de un 6,5% en promedio.
Fuente: AWS ML blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas