TutkimusAvoin lähdekoodi 🇺🇸 10.08.2026 14:02

Tiedon tislauksesta tarpeeksi edullista laajamittaiseen käyttöön

Multiverse ComputingMultiverse Computing NVIDIANVIDIA MetaMeta
Multiverse Computingin uusi artikkeli esittelee tehokkaan offline-tiedon tislauksen, jossa käytetään välimuistiin tallennettuja top-K logiitteja ja sulautettua lohkoittain jaettua KL-häviötä. Tämä vähentää VRAM:n käyttöä yli 15-kertaisesti ja mahdollistaa pitkäkontekstisen tislauksen yhdellä GPU:lla. Tekniikat alentavat merkittävästi koulutuskustannuksia, mikä tekee laajamittaisista tislauskokeista käytännöllisiä.
Tiedon tislaus, jossa pienempi opetusmalli oppii jäljittelemään suurempaa opetusmallia, on vakiintunut tekniikka suurten kielimallien pakkaamiseen. Viimeaikaiset avoimen lähdekoodin LLM-mallit, kuten Kimi-K3, jossa on 2,8 biljoonaa parametria, vaativat noin 3 teratavua VRAM-muistia, mikä tekee pakkaamisesta välttämätöntä. Artikkeli 'Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss' käsittelee tislauksen korkeita kustannuksia tallentamalla opetusmallin top-K-logitit offline-tilassa, mikä poistaa tarpeen pitää opetusmallia muistissa. Se esittelee myös yhdistetyn, paloitellun KL-häviön, joka laskee häviön paloissa välttäen koko sanaston ja sekvenssin kattavan matriisin. Tämä vähentää VRAM-muistin huippukäytön 250 gigatavusta 128 gigatavuun yhdellä H200-sirulla, mikä mahdollistaa tislauksen 32 000 merkin kontekstilla yhdellä GPU:lla neljän solmun sijaan, ja askelajat ovat 5 kertaa nopeampia. Opiskelijamalli, joka on tislattu Llama 3.1 8B Instruct -mallista 3,2 miljardin parametrin kokoon, säilyttää suurimman osan tarkkuudesta vertailutesteissä, kuten BoolQ ja HellaSwag, ja pysyy yhdeksän pisteen sisällä MMLU:ssa.
Lähde: Hugging Face blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset