TutkimusMallit 🇷🇺 11.08.2026 17:02

Mitä yhteistä on tarot-korteilla, Viterbi-algoritmilla ja kielimalleilla: miten algoritmi valitsee yhden merkityksen monien joukosta

Artikkelissa esitellään opetusmalli, joka tulkitsee tarot-korttien sarjan etsintänä johdonmukaisimmalle merkitykselliselle polulle, ja se rinnastetaan algoritmeihin, kuten Viterbi ja beam search, joita käytetään puheentunnistuksessa, konekääntämisessä ja kielimalleissa. Malli käsittelee jokaista korttia funktiona, joka kuvaa kontekstin ja alkuperäisen merkityksen tulkinta-avaruuteen, ja etsii sitten parhaan globaalin polun. Se vertailee ahneita valintoja, Viterbiä, beam searchia ja muita menetelmiä, ja käsittelee laajennuksia, jotka käyttävät faktorigraafeja, ehdollisia satunnaiskenttiä (CRF), semanttisia upotuksia ja kielimallien uudelleenjärjestystä.
Habrissa julkaistussa artikkelissa pohditaan, kuinka tarot-korttien tulkintaa voidaan mallintaa parhaan koherentin merkityspolun valintana useiden ehdokkaiden joukosta, analogisesti algoritmeille, kuten Viterbi ja beam search. Kirjoittaja lähtee liikkeelle ajatuksesta, että kortti toimii kuvauksena kontekstista ja alkuperäisestä merkityksestä joukkoon mahdollisia tulkintoja, mutta väittää, että haun yksikön tulisi olla koko semanttinen polku, ei yksittäinen tulkinta. Konkreettinen esimerkki viidellä tilalla (pysähtyneisyys, uudelleenarviointi, resurssit, toiminta, siirtymä) ja kolmella kortilla (Hirtetty, Maagi, Vaununkuljettaja) osoittaa, että ahne lähestymistapa valitsee suboptimaalisen polun verrattuna Viterbin globaaliin optimiin. Formaali malli on ehdollinen epähomogeeninen Markov-ketju, jossa Viterbin dekoodaus löytää tarkan maksimipolun ajassa O(n*S^2). Kuitenkin, kun pistemäärä riippuu koko historiasta tai vapaasta tekstistä, optimaalinen alirakenne menetetään, ja beam searchia käytetään approksimatiivisena menetelmänä; myös diverse beam search käsitellään. Artikkeli vertailee Viterbiä, beam searchia, diverse beamia, A*:ta, MCTS:ää ja LLM-uudelleenjärjestystä, ja mainitsee tekijägraafit ja lineaariset ketju-CRF:t yleisempinä formulaatioina. Siinä huomautetaan myös, että todelliset merkitykset eivät välttämättä sovi diskreetteihin tiloihin, joten semanttisia upotusvektoreita ja LLM-uudelleenjärjestystä voidaan käyttää, ja se ehdottaa suuntia kuvan muuttamiseksi tutkimukseksi tekoälytuetusta tarot-käytännöstä.
Lähde: Habr — хаб NLP — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset