Oman Warhammer 40K GPT-kaltaisen LLM:n rakentaminen alusta alkaen. Osa 4: Ohjattu hienosäätö kysymys-vastausdatalla
Hugging Face
Sarjan neljäs osa, jossa luodaan dekooderi-pohjainen LLM alusta alkaen. Keskitytään ohjattuun hienosäätöön (supervised fine-tuning, SFT) kysymys-vastausdatalla, jotta malli pystyy keskusteluun. Tekijä laajentaa tokenisoijaa erityisillä roolitokeneilla, rakentaa QA-datasettiin ja hienosäätää mallin. Havaitaan, että vaikka häviö pienenee, tuotannon laatu voi heikentyä ylisovittumisen vuoksi. Tarkistuspiste valitaan tuotannon laadun eikä pienimmän häviön perusteella.
Artikkelissa kuvataan pienen dekoderin LLM:n SFT-vaihetta Warhammer 40 000 -loreen liittyvän harjoittamisen yhteydessä. Esiopetuksen jälkeen perusmalli pystyy jatkamaan tekstiä, mutta ei kykene vastaamaan kysymyksiin. Kirjoittaja kerää kysymys-vastaus-pareja keskustelupalstoilta, artikkeleista ja synteettisestä datasta, minkä jälkeen hän rakentaa ChatQADatasetin, joka peittää häviön vain assistenttimerkkien osalta. Tokenisaattoria laajennetaan erityisillä tokeneilla <|user|> ja <|assistant|>. Mallin upotus- ja tulostuskerrokset muutetaan uusien tokenien kokoa vastaaviksi. Hienosäätö käyttää matalampaa oppimisnopeutta (yksi kertaa 10 potenssiin miinus viisi) ja kestää noin 20 minuuttia. Vaikka häviö laskee 3,7:stä 2,1:een, kirjoittaja huomauttaa ylisovittamisesta ja suosittelee valitsemaan tallennuspisteitä tuotannon laadun perusteella. Vertailu osoittaa, että perusmalli tuottaa dialogimaista tekstiä, kun taas hienosäädetty malli yrittää vastata kysymykseen.
Lähde: Habr — хаб ИИ —
Alkuperäinen
