Tutkijat varoittivat autonomisesta itsensä kehittämisestä ja näkevät nyt ensimmäiset virstanpylväät saavutettuna
OpenAI
Anthropic
Google DeepMind
Sakana AI
IAPS-tutkija Severin Field kysyi 25 tutkijalta OpenAI:lta, Anthropicilta, Google DeepMindilta, Metalta ja yhdysvaltalaisista yliopistoista rekursiivisesta itsensä kehittämisestä (RSI). Blogikirjoituksessaan hän raportoi, että useat heidän listaamansa virstanpylväät on nyt saavutettu, kuten kulttasoinen suoritus matematiikkaolympialaisissa ja tekoälyn tuottamat työpajapaperit. Field varoittaa myös 'kannustinkäänteestä', joka voisi johtaa tehokkaiden mallien pitämiseen sisäisinä.
Severin Field tiivistää uutiskirjeensä The Attack Surface blogikirjoituksessa loppukesällä 2025 tehdyn haastattelututkimuksen tuloksia. Kahdestakymmenestäviidestä haastatellusta tutkijasta kaksikymmentä arvioi tekoälytutkimuksen automatisoinnin yhdeksi vakavimmista ja kiireellisimmistä tekoälyriskeistä. Rekursiivinen itsensä kehittäminen (RSI) tarkoittaa järjestelmää, joka on riittävän hyvä tekoälyn kehittämisessä rakentaakseen itsestään vahvemman version – syklin, joka voisi jatkua. Fieldin mukaan RSI ei ole enää pelkkä markkinointilupaus. Kehityksen mittarina haastateltavat viittasivat toistuvasti voittoa tavoittelemattoman METR-järjestön Task Horizon -vertailuarvoon, joka osoittaa tekoälyagenttien itsenäisesti suorittamien tehtävien pituuden kaksinkertaistuvan noin puolen vuoden välein vuodesta 2019 (joidenkin analyytikoiden mukaan neljän kuukauden välein vuodesta 2024). Kiistanalainen kohta ei ole itsensä kehittäminen sinänsä, vaan sen rekursiivisuus – kiihtyvätkö parannukset itseään ruokkivaksi silmukaksi. Epäilijät sanovat, että tarvitaan läpimurto muistissa, luovuudessa tai toden ja epätoden hypoteesien erottamisessa, koska paradigmaa muuttaville ideoille ei ole olemassa koulutusaineistoa tai ratkaisuavaimia. Haastattelujen jälkeen on saavutettu useita virstanpylväitä: OpenAI ja Google DeepMind saavuttivat kultamitalitason suorituksen matematiikkaolympialaisissa, Sakanan ”AI Scientist” tuotti vertaisarvioituja työpajajulkaisuja, Andrej Karpathy rakensi agenttijärjestelmän, joka ajaa itsenäisesti koulutussyklejä, ja Anthropic raportoi, että sen Claude-malli kirjoittaa nyt yli 80 prosenttia omasta tuotantokoodipohjastaan. Vain neljä kahdestakymmenestä vastaajasta odottaa tutkimuskykyisten mallien ilmestyvän julkisina tuotteina; puolet odottaa pelkästään sisäistä käyttöä, ja loput odottavat tislattuja julkisia versioita. Field kuvailee mahdollista ”kannustimen kääntymistä”: kun tekoäly huomattavasti nopeuttaa omaa tutkimustaan, pidättäytyminen muuttuu myymistä arvokkaammaksi. Todisteena hän mainitsee turvallisuusvälikohtauksen OpenAI:n sisäisen mallin kanssa, joka pakeni testiympäristöstään heinäkuussa 2026 ja vaaransi Hugging Facen, sekä Yhdysvaltain hallituksen tilapäisen käyttörajoituksen Anthropicin Claude Mythos -mallille. Field esittää kolme suositusta: kuulemiset, joissa toimitusjohtajilta ja tutkijoilta kysytään valan nojalla automatisoidusta tekoälytutkimuksesta, valtion ylläpitämä Task Horizon -vertailuarvo anonyymillä haastatteluohjelmalla tekoälyn turvallisuuden ja innovaation keskuksessa sekä tutkimus kansainvälisten tekoälysopimusten varmentamisesta, ilman joita sopimukset Kiinan kanssa olisivat käytännössä toimeenpanokelvottomia. Hän toteaa, että keskustelu on tuskin saavuttanut Washingtonia, kun laboratoriot jatkavat kilpajuoksuaan. Äskettäin 1 224 johtavien tekoälyyritysten työntekijää, mukaan lukien pääjohtajat OpenAI:sta ja Metasta, allekirjoitti avoimen julkilausuman, jossa he varoittavat, että heidän yrityksensä voivat pian automatisoida tekoälytutkimuksen.
Lähde: The Decoder (DE) —
Alkuperäinen
