TutkimusAvoin lähdekoodi 🇷🇺 27.07.2026 20:04

Decoder-Only Transformerin kirjoittaminen tyhjästä Pythonilla LLM:ää varten

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
Artikkelisarjan kirjoittaja kuvaa yksityiskohtaisesti pienen decoder-only LLM:n transformer-lohkon toteutusta PyTorch-kehyksellä. Käsiteltyjä komponentteja ovat: peitetty Multi-Head Attention, Feed Forward Network GELU-aktivaatiolla, normalisointikerros ja jäännöskytkennät. Artikkeli selittää eron alkuperäiseen arkkitehtuuriin: koulutuksen vakauden takaamiseksi käytetään esinormalisointia (Pre-LN) jälkimmäisen normalisoinnin sijaan.
Kirjailija Vladimir toteuttaa transforerilohkon dekooderivainiselle kielimallille käyttäen esimerkkinä vesileimatehtävää lisensoidulle tekstille. Hän selittää, että transformeri on Googlen artikkelissa 'Attention Is All You Need' esitelty arkkitehtuuri, jossa sekvenssiä käsitellään rinnakkain huomiomekanismin avulla. Multi-Head Attention perustuu kolmeen projektio-matriisiin: Q, K, V. Ensimmäisessä vaiheessa lasketaan tokenien samankaltaisuus (huomimatriisi), ja toisessa vaiheessa tokenien sisältö sekoitetaan löydettyjen painojen mukaisesti. Tehokkuuden vuoksi kaikki huomiopäät toteutetaan yhden suuren lineaariprojektion kautta. Huomion jälkeen sovelletaan eteenpäin kytkettyä verkkoa, jossa on GELU-aktivointi ja dropout. Transformerin rakentamiseen kuuluu normalisointi (Pre-LN) ja jäännöskytkennät. Lisäksi dekooderissa käytetään kausaalimaskia. Kaiken kaikkiaan lohko on valmis käytettäväksi kielimallin kokoamisessa, harjoittelussa ja tekstin tuottamisessa.
Lähde: Habr — хаб NLP — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset