TutkimusMallit 🇺🇸 27.07.2026 14:04

Adaptiivinen rinnakkaispäättely: Uusi paradigma tekoälyn päättelyn tehokkaaseen skaalaukseen

Berkeley Artificial Intelligence ResearchBerkeley Artificial Intelligence Research
BAIR:n tutkijat analysoivat siirtymää kiinteistä rinnakkaisstrategioista adaptiiviseen rinnakkaispäättelyyn (APR), jossa malli itse päättää milloin ja miten rinnakkaistaa osatehtävät. APR vähentää peräkkäiseen päättelyyn sisältyvää redundanssia ja viivettä eikä vaadi rinnakkaisuusrakenteen manuaalista määrittelyä.
BAIR-laboratorio (Berkeley AI Research) esitteli katsauksen uudesta lähestymistavasta, adaptiivisesta rinnakkaispäättelemisestä (APR), jonka avulla tekoälymallit voivat itse päättää, milloin tehtävä kannattaa jakaa rinnakkaisiin osatehtäviin, kuinka monta säiettä käynnistää ja miten niitä koordinoidaan. Perinteiset menetelmät, kuten self-consistency (itseyhdenmukaisuus) tai best-of-N (paras N:stä), käyttävät kiinteää rinnakkaisuusrakennetta, mikä johtaa tarpeettomiin laskentatöihin. Muut lähestymistavat, kuten Tree-of-Thoughts (ajatusten puu) tai Monte Carlo -puuhaku (MCTS), edellyttävät ennalta määriteltyjä heuristiikkoja hajottamista varten. APR yleistää idean: malli oppii vahvistusoppimisen avulla tuottamaan erityisiä ohjaustoken-jaksoja, jotka määrittävät, milloin päätellä peräkkäin ja milloin rinnakkain. Tämä mahdollistaa rinnakkaisuustason dynaamisen mukauttamisen tehtävän vaikeustason mukaan, välttäen ylimääräisyyttä yksinkertaisissa kysymyksissä ja varmistaen oikean hajottamisen monimutkaisissa tehtävissä. Rinnakkaisten haarojen suorittamiseen käytetään fork-join-arkkitehtuuria: malli tuottaa osatehtäviä, jotka käsitellään rinnakkain, ja tulokset yhdistetään sen jälkeen. KV-välimuistin (avain-arvo -välimuistin) tehokkaaseen hallintaan sovelletaan päätteliikenteen moottorin muokkauksia, kuten Multiverse, Parallel-R1 ja NPR, jotka kopioivat ja liittävät KV-välimuistia riippumattomista säikeistä yhdeksi sekvenssiksi. Tämä edellyttää kuitenkin muutoksia moottoriin ja voi aiheuttaa epävakautta. Vaihtoehtoinen lähestymistapa on käyttää universaaleja renderöijä, jotka toimivat ilman moottorin muokkausta. Kaiken kaikkiaan APR:ää pidetään uutena paradigmajana, jonka avulla päättelyaikaa voidaan skaalata ilman viiveen lineaarista kasvua ja laadun heikkenemistä ”kontekstin mädäntymisen” (context decay) vuoksi.
Lähde: BAIR (Berkeley AI) — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset