Näin varmistin, että AI-agenttilaivastoni on aidosti autonominen
Anthropic
AI-agenttilaivaston operaattori kertoo, miten he rakensivat varmennusvaljaat todistaakseen agenttiensa autonomian. He määrittelivät neljä invarianttia puhtaina funktioina tapahtumalokeista ja ajoivat ne oikealla datalla. Tulokset osoittivat, että vaikka tason 2 riskit oli asianmukaisesti rajattu ihmisen hyväksynnällä, riippumatonta varmennusta ei lähes koskaan suoritettu, mikä paljasti kuilun ilmoitetun kurinalaisuuden ja todellisuuden välillä.
Käyttäjä, joka ei ole taustaltaan kehittäjä, mutta joka operoi tekoälyagenttien laivastoa, päätti todistaa, että heidän neljän koneen laivastonsa, joka kävi neuvotteluja kuuden viikon ajan, oli todella autonominen. He määrittelivät neljä invarianttia (INV-1 – INV-4) puhtaina funktioina tapahtumalokeille varmistaakseen käyttäytymissääntöjä, kuten ihmisen hyväksynnän ennen tason 2 toimien sitouttamista ja riippumattoman varmennuksen ennen sitouttamista. Suorittaessaan nämä tarkistukset 64:lle oikealle ehdotukselle ja 317:lle tapahtumalle he havaitsivat, että INV-1 (ihmisportti tason 2 toimille) läpäisi 100-prosenttisesti, mutta INV-2 (riippumaton varmennus) vain 7,7 prosenttisesti, mikä osoitti, että varmennus oli neuvoa-antavaa, ei pakotettua. INV-3 paljasti päällekkäisen tapahtumavyöryn aiheuttaman virheen, jossa keskus toisti HYVÄKSY-tapahtuman 17 kertaa, ja INV-4 paljasti viisi eskalaatiota, jotka sitoutettiin odottamatta ihmisen ratkaisua. Operaattori julkaisi nämä tulokset läpinäkyvästi, mukaan lukien todellisen jäljityksen, joka osoitti sekä asianmukaisen ihmisen hyväksyntäprosessin että saman jäljityksen epäonnistumisen INV-2:ssa, koska varmennuksen suoritti sitouttaja. He käsittelivät myös rajoituksia, virheitä ja arviointiohjelmiston avoimen lähdekoodin.
Lähde: Habr — хаб ИИ —
Alkuperäinen
