Modèles 🇷🇺 24.07.2026 10:02

Construire votre propre LLM de type GPT pour Warhammer 40K à partir de zéro. Partie 4 : Ajustement supervisé sur questions-réponses

Hugging FaceHugging Face
La quatrième partie d'une série sur la création d'un LLM décodeur seul à partir de zéro, se concentrant sur l'ajustement supervisé (SFT) sur un ensemble de données de questions-réponses pour permettre le dialogue. L'auteur étend le tokenizer avec des tokens de rôle spéciaux, construit un jeu de données de questions-réponses, et ajuste le modèle, observant que même si la perte diminue, la qualité de génération peut se dégrader en raison du surapprentissage. Le point de contrôle est sélectionné en fonction de la qualité de génération plutôt que de la perte minimale.
L'article décrit l'étape de SFT pour l'entraînement d'un petit LLM décodeur-only spécialisé dans le lore de Warhammer 40K. Après le pré-entraînement, le modèle de base peut continuer le texte mais ne peut pas répondre à des questions. L'auteur collecte des paires question-réponse provenant de forums, d'articles et de données synthétiques, puis construit un ChatQADataset qui masque la perte uniquement sur les tokens assistant. Le tokenizer est étendu avec les tokens spéciaux <|user|> et <|assistant|>. Les couches d'embedding et de sortie du modèle sont redimensionnées pour accueillir ces nouveaux tokens. Le fine-tuning utilise un taux d'apprentissage plus faible (1e-5) et dure environ 20 minutes. Bien que la perte passe de 3,7 à 2,1, l'auteur note un surapprentissage et recommande de sélectionner les checkpoints en fonction de la qualité de génération. Une comparaison montre que le modèle de base produit un texte de type dialogue tandis que le modèle fine-tuné tente de répondre à la question.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches