ModelosInvestigación 🇺🇸 24.07.2026 05:06

Razonamiento Autodestilado para el Ajuste Fino de Amazon Nova

Amazon Web ServicesAmazon Web Services
Amazon ha introducido el método de Razonamiento Autodestilado (SDR, por sus siglas en inglés) para el ajuste fino supervisado (SFT, por sus siglas en inglés) de los modelos Amazon Nova 2. SDR genera cadenas de pensamiento (CoT, por sus siglas en inglés) para conjuntos de datos que carecen de ellas, utilizando el propio modelo. Esto aborda el problema de la supresión del razonamiento y reduce el olvido catastrófico, mejorando el rendimiento objetivo mientras se mantienen las capacidades generales.
En un artículo del blog de AWS ML se investiga el problema de la supresión del razonamiento durante el ajuste fino supervisado (SFT) de modelos con datos que no contienen cadenas de razonamiento (Chain-of-Thought, CoT). Cuando se realiza SFT sin CoT, el modelo pierde la capacidad de razonar incluso con el modo de razonamiento activado, lo que provoca un olvido catastrófico. Se propone el método de Razonamiento Autodestilado (Self-Distilled Reasoning, SDR), que en una primera etapa genera CoT utilizando un modelo base de razonamiento (Amazon Nova 2 Lite), luego enriquece los datos de entrenamiento con estas trazas y realiza SFT con el modo de razonamiento activado. Los experimentos en cinco puntos de referencia (ToolACE, CoCoHD, GovReport, Invoice-OCR, CaptionGen) mostraron que SDR mejora el rendimiento objetivo en un promedio del 6,5% en comparación con la simple fusión de modelos, manteniendo al mismo tiempo una precisión matemática del 70% frente al 68% de la fusión. SDR no requiere anotación manual, funciona con cualquier dominio y es más eficaz que la fusión de modelos para prevenir el olvido catastrófico. El método utiliza el propio modelo como fuente de razonamiento, lo que es coherente con los principios de la autodestilación.
Fuente: AWS ML blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas