Synteettisen datan tuottaminen venäjän ja kazakin koodinvaihtokäännöksiin
Meta
MWS AI:n ja useiden yliopistojen tutkijat kehittivät menetelmän synteettisten rinnakkaiskorpusten tuottamiseen venäjän ja kazakin koodinvaihtokäännöksiä varten (kielten sekoitus). SimAlign-pohjaisen sananvaihdon avulla he hienosäätivät malleja, kuten NLLB-3.3B, saavuttaen ihmisten arvioiman pistemäärän 3,09/5, mikä ylitti kaupalliset järjestelmät (2,80–3,49) synteettisen datan rajoituksista huolimatta.
Koodinvaihto venäjän ja kazakstanin välillä on yleistä Kazakstanissa, mutta konekäännösmalleille ei juuri ole harjoitusdataa. MWS AI:n ja yhteistyöyliopistojen tutkijat loivat synteettisen tietoaineiston ottamalla olemassa olevia kazakstanin-venäjän rinnakkaiskorpuksia (lakiasiakirjoja, lehdistötiedotteita) ja lisäämällä keinotekoisesti venäjän sanoja kazakstaninkielisiin lauseisiin käyttäen SimAlignia, joka valitsee korvaukset kontekstin perusteella upotusten avulla. He hienosäätivät useita avoimia malleja (mBART, M2M100, NLLB-600, NLLB-3.3B) tällä synteettisellä datalla. Vaikka kaupalliset järjestelmät saivat korkeampia pisteitä automatisoiduissa mittareissa (BLEU, ChrF++, COMET), ihmisarviointi Likert-asteikolla osoitti, että hienosäädetty NLLB-3.3B-malli saavutti 3,09/5, voittaen kaksi kaupallista rajapintaa (2,80 ja 3,49). Lähestymistapa paransi suorituskykyä myös, kun lisättiin Twitter-dataa käännettynä kazakstaniksi. Synteettinen data sai kuitenkin vain 2,62/5 luonnollisuudesta, testiaineisto on pieni (618 lausetta), ja siirrettävyys muihin kielipareihin on edelleen epävarmaa.
Lähde: Habr — хаб ML —
Alkuperäinen
