Construindo seu Próprio LLM Tipo GPT para Warhammer 40K do Zero. Parte 4: Ajuste Fino Supervisionado em Pergunta-Resposta
Hugging Face
A quarta parte de uma série sobre criação de um LLM decoder-only do zero, focando no ajuste fino supervisionado (SFT) em um conjunto de dados de pergunta-resposta para permitir diálogo. O autor estende o tokenizador com tokens especiais de papéis, constrói um conjunto de dados de perguntas e respostas e ajusta o modelo, observando que, embora a perda diminua, a qualidade da geração pode degradar devido ao overfitting. O checkpoint é selecionado com base na qualidade da geração, em vez da perda mínima.
O artigo descreve a etapa de SFT (fine-tuning supervisionado) no treinamento de um pequeno LLM (Modelo de Linguagem de Grande Porte) apenas com decodificador para o lore de Warhammer 40K. Após o pré-treinamento, o modelo base consegue continuar texto, mas não responde a perguntas. O autor coleta pares de pergunta-resposta de fóruns, artigos e dados sintéticos, e então constrói um ChatQADataset que mascara a perda apenas nos tokens do assistente. O tokenizador é estendido com tokens especiais <|user|> e <|assistant|>. As camadas de embedding e saída do modelo são redimensionadas para acomodar os novos tokens. O fine-tuning usa uma taxa de aprendizado menor (1e-5) e leva cerca de 20 minutos. Embora a perda caia de 3,7 para 2,1, o autor nota sobreajuste e recomenda selecionar checkpoints com base na qualidade da geração. Uma comparação mostra que o modelo base gera texto semelhante a diálogo, enquanto o modelo fine-tuned tenta responder à pergunta.
Fonte: Habr — хаб ИИ —
original
