처음부터 나만의 Warhammer 40K GPT 스타일 LLM 구축하기. 제4부: 질문-답변 데이터로 지도 미세 조정
Hugging Face
디코더 전용 LLM을 처음부터 생성하는 시리즈의 네 번째 부분으로, 대화를 가능하게 하기 위해 질문-답변 데이터셋에 대한 지도 미세 조정(SFT)에 초점을 맞춥니다. 저자는 특수 역할 토큰으로 토크나이저를 확장하고, QA 데이터셋을 구축한 후 모델을 미세 조정하여 손실은 감소하지만 과적합으로 인해 생성 품질이 저하될 수 있음을 관찰합니다. 체크포인트는 최소 손실보다는 생성 품질을 기준으로 선택됩니다.
이 글은 워해머 40K 세계관을 위한 작은 디코더 전용 LLM의 SFT 단계를 설명합니다. 사전 학습 후 기본 모델은 텍스트를 이어갈 수 있지만 질문에 답변할 수 없습니다. 저자는 포럼, 기사 및 합성 데이터에서 질문-답변 쌍을 수집하고, 어시스턴트 토큰에 대해서만 손실을 마스킹하는 ChatQADataset을 구축합니다. 특수 토큰인 <|user|>와 <|assistant|>를 추가하여 토크나이저를 확장합니다. 새로운 토큰을 수용하기 위해 모델의 임베딩 및 출력 레이어 크기가 조정됩니다. 미세 조정은 더 낮은 학습률(1e-5)을 사용하고 약 20분 동안 실행됩니다. 손실이 3.7에서 2.1로 감소하지만, 저자는 과적합을 지적하며 생성 품질을 기준으로 체크포인트를 선택할 것을 권장합니다. 비교 결과 기본 모델은 대화와 유사한 텍스트를 출력하는 반면, 미세 조정된 모델은 질문에 답변하려고 시도합니다.
출처: Habr — хаб ИИ —
원문
