ModèlesOpen Source 🇷🇺 24.07.2026 10:02

Construire votre propre LLM de type GPT pour Warhammer 40K à partir de zéro. Partie 4 : Ajustement supervisé sur des paires question-réponse

Hugging FaceHugging Face
Dans la quatrième partie de la série d'articles, l'auteur effectue un ajustement supervisé (Supervised Fine-Tuning, SFT) de son LLM décodeur seul sur un ensemble de données de questions-réponses afin que le modèle puisse mener un dialogue plutôt que simplement continuer du texte. L'article aborde la collecte de données, l'expansion du tokenizer, la préparation du jeu de données avec masquage de la perte uniquement sur les réponses de l'assistant, et les résultats de l'entraînement : le modèle a appris le format de réponse mais souffre d'inexactitudes concernant le lore.
L'auteur de la série, Vladimir, consacre la quatrième partie au fine-tuning de son LLM decoder-only (LinguaLaboratoriumMechanicus) sur un jeu de données « question-réponse » (SFT). L'objectif est d'apprendre au modèle à mener un dialogue, et non simplement à prédire le token suivant. Les données sont collectées à partir de forums thématiques, d'articles et partiellement générées de manière synthétique. Des tokens spéciaux <|user|> et <|assistant|> sont ajoutés au tokenizer, et le vocabulaire est étendu de deux tokens. Le jeu de données ChatQADataset masque la loss : celle-ci n'est calculée que sur les tokens de réponse de l'assistant (sur les autres positions, la valeur est -100). Lors du chargement du modèle de base, le dictionnaire des embeddings et de la couche de sortie est étendu à la nouvelle taille, et les nouveaux poids sont initialisés avec la moyenne des anciens. La boucle d'entraînement utilise AdamW, un scheduler cosinus avec warmup, un gradient clipping et un learning rate plus bas (1e-5 contre 3e-4 pour le pré-entraînement). Le SFT a duré 20 minutes (15 époques). À la fin de l'entraînement, la loss est passée de 3.7 à 2.1, mais la qualité de génération a commencé à se dégrader en raison d'un surapprentissage sur un petit jeu de données. Comparaison avant/après : le modèle de base continuait le texte sous forme de dialogue (par exemple, répétant « Je ne sais pas »), tandis que le modèle fine-tuné tentait de répondre à la question (par exemple, à propos de la Tempête de la Perdition). Le modèle a appris le format de réponse, mais commet souvent des erreurs factuelles.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches