Laitteisto ja päättely 🇺🇸 02.08.2026 11:02

Transformeri-koulutuksen nopeuttaminen NVIDIA Transformer Engineerilla, sulautetuilla ytimillä, BF16:lla, FP8:lla ja GPU-vertailuilla

NVIDIANVIDIA
Tämä opetusohjelma tutkii, miten NVIDIA Transformer Engine nopeuttaa transformeri-työkuormia yhdistämällä sulautetut GPU-ytimet, BF16-laskennan ja laitteistotietoisen FP8-suorituksen. Se kattaa asennuksen, GPU-tunnistuksen, moduulikierroksen, FP8-reseptin konfiguroinnin, mallikoulutuksen, vertailun ja autoregressiivisen generaation.
Opas alkaa NVIDIA Transformer Enginen asentamisella ja PyTorch-ympäristön alustamisella. Se tunnistaa GPU-arkkitehtuurin selvittääkseen, tuetaanko TE-ytimiä ja FP8-tensorisydämiä, ja tarjoaa puhdasta PyTorch-pohjaista vararatkaisua tuetuille laitteistoille. Keskeisiä sulautettuja komponentteja, kuten te.Linear, te.LayerNorm, te.LayerNormLinear, te.LayerNormMLP ja te.TransformerLayer, tarkastellaan. Viivästetty skaalaus -FP8-resepti määritetään hybridi-E4M3/E5M2-formaateilla ja amax-historialla. Kompakti GPT-tyylinen kausaalinen kielimalli rakennetaan käyttäen sulautettuja te.TransformerLayer-lohkoja, ja vastaava puhdas PyTorch-malli toteutetaan vertailua varten. Malli koulutetaan deterministisillä synteettisillä aritmeettisilla kuviojaksoilla, ja ehdollinen FP8-automaattinen tarkkuus käytetään tuetuissa ympäristöissä. Suorituskykymittaukset mittaavat keskimääräisen askeleen latenssin ja GPU-muistin huippukäytön BF16- ja FP8-tiloissa. FP8-metatiedot, mukaan lukien skaalaustekijät ja amax-historia, tarkastetaan. Lopuksi ahne autoregressiivinen generointi vahvistaa, että malli oppii aritmeettisen askeleen, ja ehdotetaan laajennuksia, kuten suurempia malleja ja vaihtoehtoisia FP8-formaatteja.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset