Keskustelu suurista kielimalleista: tulevatko LLM:t monipuolisemmiksi – vai erikoistuneemmiksi?
OpenAI
Anthropic
Alibaba/Qwen
Moonshot AI
Google DeepMind
Entinen OpenAI:n työntekijä Andrew Ho on perustanut startupin korkealaatuiselle koulutusdataille, koska hän epäilee suurten kielimallien yleistymiskykyä. Hänen skeptisyytensä saa tukea Cambridgen ja Google DeepMindin tutkijoilta, jotka huomaavat, että nykyiset tekoälyjärjestelmät erikoistuvat enemmän kuin monipuolistuvat.
Andrew Ho jätti OpenAI:n kahdeksan kuukauden jälkeen vedoten suurten kielimallien heikkoon yleistykseen ja epätasaisiin kykyihin jopa hyvin rahoitetuilla alueilla, kuten ohjelmoinnissa. Hän uskoo ongelman johtuvan riittämättömästä harjoitusdatasta, sillä useimmat taloudellisesti merkittävät taidot ovat vain heikosti edustettuina olemassa olevissa data-aineistoissa. Ho arvioi, että tekoälylaboratorioiden on käytettävä yli 100 miljardia dollaria kohdennettuun datan hankintaan, koska pelkkä skaalaaminen ei riitä. Hän suhtautuu skeptisesti myös rajalaboratorioiden, kuten OpenAI:n ja Anthropicin, korkeisiin arvostuksiin todeten, että ne ovat kroonisesti tappiollisia ja joutuvat jatkuvasti investoimaan pysyäkseen kilpailussa halvempien kilpailijoiden, kuten Qwenin ja Kimin, kanssa. Hänen ensimmäiset tuotteensa keskittyvät bioinformatiikan ja arkilaboratoriotyön data-aineistoihin, joissa nykyiset mallit, kuten GPT-5.6 Sol, saavuttavat vain noin 30 prosentin onnistumisasteen. Adam Hunt Cambridgesta tukee tätä näkemystä ja huomauttaa, että uusimmista malleista tulee yhä erikoistuneempia: koodauksen ja monimutkaisen matematiikan osaaminen kasvaa, kun taas muut alueet pysähtyvät. Tom Zahavy Google DeepMindista tarjoaa rakenteellisen selityksen: kielimallit hallitsevat deduktion ja induktion, mutta epäonnistuvat luovassa abduktiossa. Hän ehdottaa toiminnallisesti ohjattavia maailmanmalleja mahdolliseksi tien ulos.
Lähde: The Decoder (DE) —
Alkuperäinen
