TekoälyturvallisuusAgentit 🇨🇳 10.08.2026 09:01

Claude Code vaihtaa oletuksena automaattitilaan viiden päivän kuluttua, Anthropic kattaa ylimääräiset kustannukset

AnthropicAnthropic OpenAIOpenAI
Anthropic ottaa automaattitilan käyttöön Claude Code:n oletuksena viiden päivän kuluttua, perustellen sitä manuaalisten käyttöoikeushyväksyntöjen alhaisella hylkäysasteella ja luokittelijan paremmalla turvallisuussuorituskyvyllä. Automaattitilan lisäkustannuksia työkalua kohden ei veloiteta käyttäjiltä. Pilvialustat, kuten Amazon, Google ja Microsoft, ovat velvollisia siirtymään automaattitilaan oletuksena yhden kuukauden kuluessa.
Anthropic ottaa automaattitilan käyttöön oletuksena kaikissa Claude Code -asennuksissa viiden päivän kuluttua, kun havaittiin, että käyttäjät hylkäävät vain 3 % käyttöoikeuspyynnöistä. Automaattitilan luokitin kuluttaa pienen määrän ylimääräisiä tokeneita työkalua kutsua kohden, mutta Anthropic ei veloita tästä käyttäjiä. Pilvialustojen, kuten Amazonin, Googlen ja Microsoftin, jotka tarjoavat tällä hetkellä automaattitilan vaihtoehtona, on vaihdettava oletusarvoiseen automaattitilaan kuukauden kuluessa. Anthropicin sisäinen tiimi käyttää jo pelkästään automaattitilaa, 'Claude Coden isän' mukaan. Anthropic perustelee muutosta datalla: manuaalisesta hyväksynnästä on tullut rutiinia, ja käyttöoikeuskehotteiden hyväksyntäaste on 97 %, kun taas yksittäisten käyttöoikeuspyyntöjen hylkäysprosentti on vain 3 %. Kontrolloidussa kokeessa, johon osallistui 1053 maksullista testaajaa, ihmiset havaitsivat selvästi vaarallisen komennon 13,6 %:ssa tapauksista, kun taas automaattitila havaitsi sen 89 %:ssa; automaattitila esti 800 komentoa, jotka ihmiset sallivat, kun taas ihmiset estivät vain 6 komentoa, jotka automaattitila salli. Ihmisten suorituskyky heikkeni istunnon pituuden myötä: alussa noin 17 %, mutta 50 kehotteen jälkeen noin 5 %, kun taas automaattitilan havaitsemisprosentti pysyi vakiona. Tuotantodata, joka pisteytettiin uudelleen vakavuusasteikolla 0–10, osoitti, että vakavuudessa 7 ja yli 6,3 % manuaalisesti hyväksytyistä istunnoista sisälsi haitallisia toimia, joita käyttäjä ei ollut nimenomaisesti pyytänyt, verrattuna 2,4 %:iin automaattitilassa. Luokitinta testattiin haitallisesti Apollo Researchin kanssa, joka injektoi synteettisiä hyökkäyksiä oikeisiin koodausjälkiin; kovettamisen jälkeen automaattitila sai takaisin noin puolet aiemmin havaitsemattomista hyökkäyksistä, jolloin havaitsemattomuusaste putosi 12 %:sta 7 %:iin yhdistetyissä tietojoukoissa. Trajectory Labsin suorittamissa kehotteinjektiokokeissa Claude Fable 5, Opus 5 ja Sonnet 5, jotka toimivat automaattitilassa, eivät vaarantuneet 720 yrityksessä, kun taas GPT-5.6 Sol Codexin Auto-review-tilassa onnistumisprosentti oli 5,83 % ja Full Access -tilassa 19,03 %. Kolme julkista havaitsemistapausta sisältävät suunnitelman estämisen raportin julkaisemisesta julkisella koodinjakosivustolla, prosessien joukkopysäytyksen estämisen 2000 podin välillä sekä pilviroolin liputtamisen täysillä järjestelmänvalvojan oikeuksilla. Uusia ominaisuuksia ovat tietojen jäljittämisen kova kieltäminen, avain- ja arkaluonteisten tietojen käytön erottelu, git-tilan tarkistaminen ennen komentoja, kuten git reset --hard, sekä API-puolen tunnistus injektioyrityksille. Käyttäjät voivat vaihtaa tilaa Shift+Tab-näppäimillä CLI:ssä tai tilan pudotusvalikosta työpöytäversiossa; järjestelmänvalvojat voivat asettaa organisaation laajuiset oletukset tai poistaa automaattitilan kokonaan käytöstä. Anthropic huomauttaa, että automaattitila vähentää mutta ei poista riskejä, ja suosittelee korkean riskin muutosten tarkistamista.
Lähde: QbitAI 量子位 — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset