PesquisaModelos 🇺🇸 24.07.2026 05:06

Raciocínio Autodestilado para o Fine-Tuning do Amazon Nova

Amazon Web ServicesAmazon Web Services
A Amazon explora o raciocínio autodestilado (SDR) para gerar cadeias de pensamento (chain-of-thought) para o fine-tuning supervisionado (SFT) quando essas cadeias estão ausentes. O SDR reutiliza o próprio raciocínio do modelo base Amazon Nova 2 Lite, mitigando o esquecimento catastrófico e melhorando o desempenho alvo sem anotação humana.
Ao ajustar fino um modelo com aprendizado fino supervisionado (SFT), criar cadeias de raciocínio (CoT) de alta qualidade é frequentemente impraticável. Sem essas cadeias, o modelo pode perder sua capacidade de raciocínio devido ao problema de supressão de raciocínio. A Amazon propõe o Auto-Destilamento de Raciocínio (SDR), que utiliza o modelo base Amazon Nova 2 Lite para gerar cadeias de raciocínio para cada exemplo de SFT, depois as adiciona ao início das saídas originais e realiza o ajuste fino com o modo de raciocínio ativado. O SDR não requer anotação humana, é aplicável em vários domínios e preserva a capacidade de raciocínio de forma mais eficaz do que a fusão de modelos. Experimentos em benchmarks como ToolACE, CoCoHD, GovReport, Invoice-OCR e CaptionGen mostram que o SDR mitiga o esquecimento catastrófico, mantém o desempenho em matemática (70% contra 68% com fusão de modelos) e melhora o desempenho alvo em mais de 6,5% em média.
Fonte: AWS ML blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas