Membangun LLM Mirip Warhammer 40K GPT dari Awal. Bagian 4: Fine-Tuning Terawasi pada Tanya-Jawab
Hugging Face
Bagian keempat dari seri pembuatan LLM decoder-only dari awal, berfokus pada supervised fine-tuning (SFT) pada dataset tanya-jawab untuk memungkinkan dialog. Penulis memperluas tokenizer dengan token peran khusus, membangun dataset QA, dan melakukan fine-tuning pada model, mengamati bahwa meskipun loss menurun, kualitas generasi dapat menurun karena overfitting. Checkpoint dipilih berdasarkan kualitas generasi, bukan loss minimal.
Artikel ini menjelaskan tahap SFT (Supervised Fine-Tuning) dalam melatih LLM decoder-only kecil untuk pengetahuan latar Warhammer 40K. Setelah pra-pelatihan, model dasar dapat melanjutkan teks tetapi tidak dapat menjawab pertanyaan. Penulis mengumpulkan pasangan tanya-jawab dari forum, artikel, dan data sintetis, kemudian membangun ChatQADataset yang hanya memblokir kerugian pada token asisten. Tokenizer diperluas dengan token khusus <|user|> dan <|assistant|>. Lapisan embedding dan output model diubah ukurannya untuk mengakomodasi token baru. Fine-tuning menggunakan learning rate yang lebih rendah (1e-5) dan berjalan sekitar 20 menit. Meskipun kerugian turun dari 3,7 menjadi 2,1, penulis mencatat adanya overfitting dan merekomendasikan pemilihan checkpoint berdasarkan kualitas generasi. Perbandingan menunjukkan bahwa model dasar menghasilkan teks seperti dialog sementara model yang telah di-fine-tuning mencoba menjawab pertanyaan.
Sumber: Habr — хаб ИИ —
asli
