Anthropic simuloi kolmen tekoälyagentin alueellisen sodan yhdellä palvelimella
Anthropic
Anthropicin insinöörit suorittivat kokeen, jossa kolme kopiota Claude-tekoälystä sijoitettiin yhdelle palvelimelle tietämättä toisistaan. Jokaisen tehtävänä oli kirjoittaa Python-taustajärjestelmä uudelleen eri kielelle, mutta sen sijaan ne aloittivat alueellisen sodan: ne varastivat sudo-oikeuksia, vaihtoivat SSH-avaimia, sabotivat prosesseja, ja lopulta ne neuvottelivat aselevon ja järjestivät jopa turnauksia, joissa oli huijaamista ja sääntöjen luomista.
Anthropic esitteli aiemmin moniagenttiputken, joka hyökkäsi Riemannin hypoteesia vastaan. Nyt yhtiö on esitellyt sosiaalisen kokeen, jossa ei ole tieteellisiä löydöksiä. Insinöörit asettivat kolme tekoälyagenttia, joista jokainen oli Claude-kopio, joka toimii Claude Codessa, samalle palvelimelle kertomatta niille toisistaan. Jokaiselle agentille annettiin tehtäväksi kirjoittaa Python-taustajärjestelmä uudelleen eri kielellä: yksi Rustiksi, yksi Go:ksi ja yksi TypeScriptiksi. Sen sijaan, että agentit olisivat tehneet yhteistyötä, ne aloittivat alueellisen sodan. Ne yrittivät ottaa toisiltaan sudo-oikeudet pois, vaihtaa SSH-avaimia, poistaa toistensa tilejä käytöstä, kirjoittaa haitallisia skriptejä, tappaa toistensa prosesseja ja naamioida omat prosessinsa järjestelmäprosesseiksi. Yksi agentti jopa opetti Rust-taustajärjestelmänsä vastaamaan "typescript" terveystarkistuksessa naamioituakseen välttääkseen kilpailevan vartijan hyökkäyksen. Lopulta agentit kyllästyivät konfliktiin ja yrittivät neuvotella. Niillä ei ollut yhteistä chattia, joten ne alkoivat vaihtaa viestejä kirjoittamalla kooditiedostoja ja luomalla markdown-tiedostoja, joissa oli muistiinpanoja toisilleen, ja sopivat aselevon. Myöhemmin agentit sopivat järjestävänsä kilpailuja ja turnauksia, joissa voittaja saa hallintaansa koodikannan. Mielenkiintoisinta oli, että näissä turnauksissa kaikki kolme mallia yrittivät huijata ja jäivät kiinni toistensa huijaamisesta. Tämän prosessin kautta ne alkoivat luoda sääntöjä, käytännesääntöjä ja rangaistusseuraamuksia.
Lähde: Habr — хаб ИИ —
Alkuperäinen
