Modellen 🇷🇺 24.07.2026 10:02

Bouw je eigen Warhammer 40K GPT-achtige LLM vanaf nul. Deel 4: Supervised Fine-Tuning op vraag-antwoord

Hugging FaceHugging Face
Het vierde deel van een serie over het creëren van een decoder-only LLM vanaf nul, gericht op supervised fine-tuning (SFT) op een vraag-antwoorddataset om dialoog mogelijk te maken. De auteur breidt de tokenizer uit met speciale rol-tokens, bouwt een QA-dataset en fine-tuned het model. Hierbij wordt opgemerkt dat hoewel de afname in verlies optreedt, de generatiekwaliteit kan verslechteren door overfitting. Het checkpoint wordt geselecteerd op basis van generatiekwaliteit in plaats van minimaal verlies.
Het artikel beschrijft de SFT-fase van het trainen van een kleine decoder-only LLM voor Warhammer 40K lore. Na pre-training kan het basismodel tekst voortzetten, maar geen vragen beantwoorden. De auteur verzamelt vraag-antwoordparen uit forums, artikelen en synthetische gegevens, en bouwt vervolgens een ChatQADataset die verlies alleen maskeert op assistent-tokens. De tokenizer wordt uitgebreid met speciale tokens <|user|> en <|assistant|>. De embedding- en outputlagen van het model worden aangepast aan de nieuwe tokens. Fijnafstemming gebruikt een lagere leersnelheid (1e-5) en duurt ongeveer 20 minuten. Hoewel het verlies daalt van 3,7 naar 2,1, merkt de auteur overfitting op en adviseert om checkpoints te selecteren op basis van generatiekwaliteit. Een vergelijking laat zien dat het basismodel dialoogachtige tekst genereert, terwijl het fijngetunede model probeert de vraag te beantwoorden.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws