Tự Suy Luận Từ Mô Hình Gốc Cho Tinh Chỉnh Amazon Nova
Amazon Web Services
Amazon khám phá phương pháp tự suy luận từ mô hình gốc (self-distilled reasoning - SDR) để tạo ra các dấu vết suy luận dạng chuỗi tư duy cho tinh chỉnh có giám sát (supervised fine-tuning - SFT) khi các dấu vết này bị thiếu. SDR tái sử dụng khả năng suy luận của mô hình gốc Amazon Nova 2 Lite, giảm thiểu việc quên lãng thảm khốc và cải thiện hiệu suất mục tiêu mà không cần chú thích thủ công.
Khi tinh chỉnh một mô hình bằng phương pháp supervised fine-tuning (SFT), việc tạo ra các chuỗi suy luận (chain-of-thought, CoT) chất lượng cao thường không khả thi. Nếu không có chuỗi suy luận, mô hình có thể mất khả năng suy luận do vấn đề triệt tiêu suy luận (reasoning suppression problem). Amazon đề xuất phương pháp Self-Distilled Reasoning (SDR), sử dụng mô hình cơ sở Amazon Nova 2 Lite để tạo chuỗi suy luận cho mỗi mẫu SFT, sau đó nối chúng vào đầu ra gốc và tinh chỉnh ở chế độ suy luận. SDR không yêu cầu chú thích thủ công, áp dụng được trên nhiều lĩnh vực và bảo toàn khả năng suy luận hiệu quả hơn so với hợp nhất mô hình (model merging). Các thử nghiệm trên các bộ benchmark như ToolACE, CoCoHD, GovReport, Invoice-OCR và CaptionGen cho thấy SDR giảm thiểu hiện tượng quên thảm khốc (catastrophic forgetting), duy trì hiệu suất toán học (70% so với 68% khi hợp nhất mô hình) và cải thiện hiệu suất mục tiêu trung bình hơn 6,5%.
Nguồn: AWS ML blog —
bản gốc
