416 testiä ja 'tuhoa kaikki' -painike: missä agenttiprojektit murtuvat
Anthropic
Kuuden agenttiprojektin analyysi paljastaa toistuvia puutteita: turvallisuus vain tekstinä, peruuttamattomat toimet ilman portteja ja nolla käyttäytymistestiä. Jopa kypsä avoimen lähdekoodin projekti regressiotesteineen puuttuu turvatoimet peruuttamattomien sähköpostien lähetyksessä. Kirjoittaja ehdottaa kymmentä diagnostista kysymystä agenttijärjestelmän kypsyyden arvioimiseksi.
Kirjoittaja on pyörittänyt helmikuusta 2026 lähtien autonomista agenttia nimeltä Groundhog (Surok) tutkimussilmukassa yhdessä Claude Coden ja --dangerously-skip-permissions -lipun kanssa. Tämän jälkeen hän auditoi kuusi omaa agenttiprojektiaan kuudesta lähteestä (mukaan lukien Sberin AI-DISRUPT PDLC -metodologia) kootulla tarkistuslistalla ja löysi kolme toistuvaa epäonnistumismallia: turvallisuus pakotettu vain kehotteisiin (malli voidaan ohittaa), peruuttamattomat toiminnot ilman vahvistusta (esimerkiksi rebuild-komento pyyhkii kaiken rikastetun datan) ja nolla regressiotestiä käyttäytymisvirheille. Kirjoittaja tarkasteli myös anonyymiä suurta avoimen lähdekoodin agenttiprojektia: siinä oli kooditason käyttöoikeustarkistuksia ja regressiotestejä aiempien virheiden varalta, mutta se lähetti silti sähköposteja peruuttamattomasti ilman luonnos- tai vahvistusvaihetta. Uudempi avoimen lähdekoodin viitekehys (HarnessX) tarjoaa interrupt_on-portin, mutta se on valinnainen eikä oletusarvoinen. Sberin PDLC-metodologia virallistaa monia puuttuvista kontrollerista: käytäntö koodina, evaluaatiot valmistumissopimuksina, ja R0–R5-lupatikapu, jossa pakollinen peruutus/palautus tilaa muuttaville operaatioille tasolla R3 ja sitä korkeammilla. Kirjoittaja rakensi seitsemännen projektin, jossa sovellettiin joitain opittuja asioita: nyt evaluaatiot suoritetaan ennen jokaista julkaisua ja tapauksista tulee nimettyjä regressiotestejä.
Lähde: Habr — хаб ИИ —
Alkuperäinen
