Modelos 🇷🇺 24.07.2026 10:02

Construyendo tu propio LLM tipo GPT para Warhammer 40K desde cero. Parte 4: Ajuste fino supervisado en preguntas y respuestas

Hugging FaceHugging Face
La cuarta parte de una serie sobre la creación de un LLM solo decodificador desde cero, centrada en el ajuste fino supervisado (SFT) en un conjunto de datos de preguntas y respuestas para habilitar el diálogo. El autor extiende el tokenizador con tokens de rol especiales, construye un conjunto de datos de preguntas y respuestas, y ajusta finamente el modelo, observando que mientras la pérdida disminuye, la calidad de la generación puede degradarse debido al sobreajuste. El punto de control se selecciona basándose en la calidad de la generación en lugar de la pérdida mínima.
El artículo describe la etapa de SFT (supervised fine-tuning) en el entrenamiento de un pequeño LLM (modelo de lenguaje grande) solo decodificador para el lore de Warhammer 40K. Después del preentrenamiento, el modelo base puede continuar texto pero no puede responder preguntas. El autor recopila pares de preguntas y respuestas de foros, artículos y datos sintéticos, luego construye un ChatQADataset que enmascara la pérdida solo en los tokens del asistente. El tokenizador se extiende con tokens especiales <|user|> y <|assistant|>. Las capas de embeddings y de salida del modelo se redimensionan para acomodar los nuevos tokens. El ajuste fino utiliza una tasa de aprendizaje más baja (1e-5) y se ejecuta durante aproximadamente 20 minutos. Aunque la pérdida cae de 3.7 a 2.1, el autor señala sobreajuste y recomienda seleccionar puntos de control basados en la calidad de la generación. Una comparación muestra que el modelo base genera texto similar a un diálogo, mientras que el modelo ajustado intenta responder la pregunta.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas