Eigenen Warhammer 40K GPT-ähnlichen LLM von Grund auf erstellen. Teil 4: Überwachte Feinabstimmung für Frage-Antwort
Hugging Face
Der vierte Teil einer Serie zur Erstellung eines Decoder-Only-LLM von Grund auf konzentriert sich auf die überwachte Feinabstimmung (SFT) mit einem Frage-Antwort-Datensatz, um Dialoge zu ermöglichen. Der Autor erweitert den Tokenizer um spezielle Rollen-Token, erstellt einen QA-Datensatz und führt die Feinabstimmung durch. Dabei wird beobachtet, dass der Verlust zwar sinkt, die Generierungsqualität jedoch aufgrund von Überanpassung abnehmen kann. Der Checkpoint wird basierend auf der Generierungsqualität und nicht auf minimalem Verlust ausgewählt.
Der Artikel beschreibt die SFT-Phase (Supervised Fine-Tuning) beim Training eines kleinen Decoder-only-LLM (Large Language Model) für die Warhammer-40K-Lore. Nach dem Pre-Training kann das Basismodell zwar Texte fortsetzen, aber keine Fragen beantworten. Der Autor sammelt Frage-Antwort-Paare aus Foren, Artikeln und synthetischen Daten und erstellt ein ChatQADataset, bei dem der Verlust nur auf Assistant-Token maskiert wird. Der Tokenizer wird um die speziellen Token <|user|> und <|assistant|> erweitert. Die Einbettungs- und Ausgabeschichten des Modells werden angepasst, um die neuen Token aufzunehmen. Das Feintuning verwendet eine niedrigere Lernrate (1e-5) und läuft etwa 20 Minuten. Obwohl der Verlust von 3,7 auf 2,1 sinkt, stellt der Autor Overfitting fest und empfiehlt, Checkpoints basierend auf der Generierungsqualität auszuwählen. Ein Vergleich zeigt, dass das Basismodell dialogartigen Text ausgibt, während das feingetunte Modell versucht, die Frage zu beantworten.
Quelle: Habr — хаб ИИ —
Original
