MallitTutkimus 🇷🇺 13.08.2026 00:05

Kuinka epäonnistuin saamaan Gemma 4:n kirjoittamaan hyvää venäläistä runoutta: Varoittava tarina ylisovittamisesta ja sokeista mittareista

Google/DeepMindGoogle/DeepMind
AI-insinööri Daniil Sheremet käytti kuukauden hienosäätäen Gemma 4:ää kirjoittamaan venäläistä runoutta oikealla metrillä ja riimillä, mutta kaikki hienosäädetyt versiot alisuoriutuivat perusmalliin verrattuna. Todellinen syyllinen ei ollut malli vaan viallinen arviointiputki: räätälöity arvioija, joka ei pystynyt erottamaan runoutta proosasta, sekä tokenisointiongelma painomerkkien kanssa. Kun arvioija korjattiin ja suoritettiin asianmukaiset A/B-testit, perusmalli voitti, korostaen kriittistä opetusta LLM-tulosten arvioinnista.
Daniil Sheremet, tekoälyinsinööri Agentic Labissa, käytti kuukauden yrittäessään saada Gemma 4:n kirjoittamaan venäläistä runoutta oikealla jaambimittalla ja riimeillä. Hänen suunnitelmansa sisälsi hienosäädön LoRA:lla, kriitikko-tarkistajajärjestelmän, rajoitetun dekoodauksen ja muita tekniikoita. Hän rakensi räätälöidyn runoskannerin, joka perustui Ilja Kozyrevin RPST-työkaluun, mittojen ja riimien arvioimiseksi. Hän kokosi aineiston ArsPoeticasta luoden 13 342 koulutusparia ohjaustunnisteineen. Ensimmäinen LoRA-ajo (v1) tuotti siansaksaa, kuten 'нагосты' ja 'гу́нты', johtuen ylisovittamisesta ja stressimerkkien käytöstä koulutustavoitteissa, mikä pirstoi tokenit. Toinen ajo (v2) puhtailla tavoitteilla ja pienemmällä oppimisnopeudella tuotti johdonmukaisempaa, mutta edelleen puutteellista säettä, ja A/B-testi viittasi siihen, että se oli perusmallia parempi. Arviointiohjelma osoittautui kuitenkin sokeaksi: se ei pystynyt erottamaan runoutta proosasta, ja kaikki aiemmat sijoitukset olivat kohinaa. Kun arvioija korjattiin neuroverkkoon perustuvalla aksenttorilla (RUAccent), paremmalla riimintunnistuksella ja painotetuilla mittareilla, perusmalli Gemma 4 voitti molemmat hienosäädetyt versiot sekä keskiarvo- että parhaan-neljän tuloksissa. Hienosäädetyt mallit optimoivat mittaa riimien kustannuksella, oppien täsmälleen sen, mitä tunnisteet korostivat. Tarina korostaa robustin arvioinnin tärkeyttä ja eksoottisten tokenavaruksien välttämistä hienosäädössä.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset