Xây dựng Warhammer 40K GPT-like LLM từ đầu. Phần 4: Tinh chỉnh có giám sát trên câu hỏi-trả lời
Hugging Face
Phần thứ tư của loạt bài về tạo một LLM chỉ có bộ giải mã từ đầu, tập trung vào tinh chỉnh có giám sát (SFT) trên tập dữ liệu câu hỏi-trả lời để hỗ trợ hội thoại. Tác giả mở rộng tokenizer với các token vai trò đặc biệt, xây dựng tập dữ liệu QA, và tinh chỉnh mô hình, quan sát thấy rằng mặc dù loss giảm, chất lượng sinh có thể suy giảm do overfitting. Checkpoint được chọn dựa trên chất lượng sinh thay vì loss tối thiểu.
Bài viết mô tả giai đoạn SFT (Supervised Fine-Tuning) trong quá trình huấn luyện một mô hình ngôn ngữ nhỏ chỉ dùng bộ giải mã cho truyền thuyết Warhammer 40K. Sau tiền huấn luyện, mô hình cơ sở có thể tiếp tục văn bản nhưng không thể trả lời câu hỏi. Tác giả thu thập các cặp câu hỏi-trả lời từ diễn đàn, bài báo và dữ liệu tổng hợp, sau đó xây dựng một ChatQADataset để che loss chỉ trên token trợ lý. Bộ mã hóa được mở rộng với các token đặc biệt <|user|> và <|assistant|>. Kích thước lớp nhúng và lớp đầu ra của mô hình được điều chỉnh để phù hợp với các token mới. Tinh chỉnh sử dụng tốc độ học thấp hơn (1e-5) và chạy trong khoảng 20 phút. Mặc dù loss giảm từ 3,7 xuống 2,1, tác giả lưu ý về hiện tượng overfitting và khuyến nghị chọn các checkpoint dựa trên chất lượng sinh văn bản. Một so sánh cho thấy mô hình cơ sở tạo ra văn bản giống hội thoại trong khi mô hình đã tinh chỉnh cố gắng trả lời câu hỏi.
Nguồn: Habr — хаб ИИ —
bản gốc
