TutkimusMallit 🇺🇸 10.08.2026 13:03

Startupit jahtaavat seuraavaa suurta asiaa LLM-mallien saralla

Liquid AILiquid AI
Uusi startup-aalto yrittää voittaa transformereiden, nykyisten LLM-mallien taustalla olevan teknologian, rajoitteet. Ne ehdottavat uusia arkkitehtuureja ja tekniikoita, joiden avulla malleista tulisi nopeampia, tehokkaampia ja mahdollisesti älykkäämpiä, tavoitteena syrjäyttää tekoälyjätit.
Vuonna 2017 julkaistussa Google-tutkimuspaperissa esitellyt transformerialgoritmit ovat jokaisen merkittävän suuren kielimallin perusta, mutta niiden tiheä huomiomekanismi on laskennallisesti kallista ja kamppailee pitkien kontekstien kanssa. Startup-yritykset tarttuvat näihin puutteisiin: Subquadratic väittää harvaan huomioon perustuvan SubQ-mallinsa kilpailevan valtavirran kielimallien kanssa; Manifest AI korvaa huomion 'tehon säilytyksellä' ja on julkaissut PowerCoderin ja Brumbyn; Liquid AI yhdistää transformerialgoritmit nestemäisiin neuroverkkoihin luodakseen hybridisiä LFM-malleja (nestemäisiä perusmalleja), jotka ovat pienempiä ja energiatehokkaampia; Inception käyttää diffuusiomenetelmää tuottaakseen kokonaisia tekstilohkoja kerralla, ja sen Mercury 2 -malli väitetään olevan 10 kertaa nopeampi kuin GPT-4; ja Pathwayn 'Dragon Hatchling' -malli loistaa sudokutehtävissä, mikä viittaa siirtymiseen kielen ulkopuolelle. Nämä startupit näkevät mahdollisuuden muuttaa tapaa, jolla suuria kielimalleja rakennetaan, ja niillä on potentiaalia merkittäviin parannuksiin nopeudessa, tehokkuudessa ja kyvykkyydessä.
Lähde: MIT Technology Review — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset