Adoben tutkijat ja Stanfordin ja Princetonin tiedemiehet ehdottavat videomaailman malleja, joissa on pitkäaikainen muisti tilamalleihin perustuen
Princeton University (Sengupta Lab)
Tutkijat Stanfordin yliopistosta, Princetonin yliopistosta ja Adobesta ovat kehittäneet uuden videomaailman malliarkkitehtuurin nimeltä LSSVWM, joka käyttää tilamalleja laajentaakseen ajallista muistia tehokkaasti. Malli ratkaisee huomiointimekanismien neliölliset laskentakustannukset käyttämällä lohkokohtaista SSM-skannausta ja tiheää paikallista huomiota, mahdollistaen pitkäaikaisen muistin tehtäviin kuten spatiaaliseen hakuun ja päättelyyn Minecraft- ja Memory Maze-ympäristöissä.
Uusi tutkimusartikkeli "Pitkän kontekstin tila-avaruusvideomaailmamallit" Stanfordin yliopiston, Princetonin yliopiston ja Adobe Researchin tutkijoilta ehdottaa ratkaisua videomaailmamallien pitkäaikaismuistin pullonkaulaan. Keskeinen ongelma on, että perinteisillä huomiokerroksilla on neliöllinen laskennallinen kompleksisuus sekvenssin pituuden suhteen, mikä tekee pitkäaikaismuistista epäkäytännöllistä. Kirjoittajat esittelevät Long-Context State-Space Video World Model -mallin (LSSVWM), joka hyödyntää tila-avaruusmalleja (State-Space Models, SSM) tehokkaaseen kausaaliseen sekvenssimallinnukseen. Keskeisiä suunnitteluvalintoja ovat lohkokohtainen SSM-skannausjärjestelmä, joka vaihtaa jonkin verran spatiaalista johdonmukaisuutta pidempään ajalliseen muistiin, ja tiheä paikallinen huomio, joka ylläpitää hienojakoisia yksityiskohtia. Kaksi harjoitusstrategiaa, Diffusion Forcing ja Frame Local Attention, parantavat entisestään pitkän kontekstin suorituskykyä. Arvioinnit Memory Maze- ja Minecraft-tietojoukoilla osoittavat, että LSSVWM ylittää huomattavasti perustasot pitkän kantaman muistin säilyttämisessä samalla kun se ylläpitää käytännöllisiä päättelynopeuksia.
Lähde: Synced —
Alkuperäinen
