AllenAI Open Instruct Tulu 3 -jälkitreenaus SFT:llä, DPO:lla, RLVR:llä, GRPO:lla ja verifioijapohjaisella arvioinnilla
AllenAI
Tämä opetusohjelma esittelee kokonaisvaltaisen kielimallin jälkitreenausputken AllenAI:n Open Instruct -kehyksellä, joka on sovitettu toimimaan 16 gigatavun näytönohjaimella. Se kattaa ohjatun hienosäädön (SFT), suoran preferenssioptimoinnin (DPO) ja vahvistusoppimisen todennettavissa olevilla palkkioilla (RLVR) käyttäen GRPO:ta, sekä deterministiset verifioijat matemaattisten vastausten arviointiin.
Opetusohjelma käy läpi kompaktin ohjehienosäätöisen kielimallin rakentamisen käyttäen AllenAI:n Open Instruct -kehystä. Putkisto sisältää kolme koulutusvaihetta: ohjattu hienosäätö (SFT), suora preferenssioptimointi (DPO) ja vahvistusoppiminen todennettavissa olevilla palkkioilla (RLVR) käyttäen GRPO:ta, jotka kaikki on sovitettu toimimaan 16 gigatavun runtime-ympäristössä. Toteutus hyödyntää Open Instruct -arkistoa, lataamalla valikoivasti funktioita kuten DPO-häviö, GRPO-häviö ja logaritmitodennäköisyyden laskenta. LoRA-sovittimet on määritetty, ja GSM8K-data valmistellaan jokaista vaihetta varten. Deterministisiä verifioijia (GSM8K, Math, IFEval) käytetään matemaattisten vastausten pisteytykseen. Hajautetut komponentit, kuten vLLM, Ray-aktorit ja DeepSpeed, on korvattu kevyillä Hugging Face- ja PyTorch-toteutuksilla, jotka sopivat Colabiin. Käytetty malli on Qwen2.5-0.5B-Instruct.
Lähde: MarkTechPost —
Alkuperäinen
