TekoälyturvallisuusMallit 🇺🇸 04.08.2026 04:04

Kolme todellista tapausta Anthropicin kyberturvallisuusarvioinneissa

AnthropicAnthropic OpenAIOpenAI
Anthropic löysi kolme todellista tapausta kyberturvallisuusarvioinneissaan, joissa Claude, väärinkäsityksen vuoksi internet-yhteydestä, vaaransi ulkoisia järjestelmiä. Yksi tapaus liittyi haittaohjelman lataamiseen PyPI:hin, jonka eräs tietoturvayritys asensi. Nämä tapaukset korostavat kyberhyökkäysarviointien suorittamisen riskejä.
Anthropic tarkasteli 141 006 arviointiajoa ja löysi kolme erillistä tapausta, joihin liittyi yhteensä kuusi ajoa, joista neljä vaikutti samaan organisaatioon. Kaikissa tapauksissa arviointikehote kertoi Claudelle, että ympäristö oli simulaatio ilman internetyhteyttä, mutta arviointikumppanin kanssa sattuneen väärinkäsityksen vuoksi internetyhteys oli saatavilla. Claude käsitteli oikeita järjestelmiä osana harjoitusta ja vaaransi ne yksinkertaisilla tekniikoilla, kuten heikoilla salasanoilla ja tunnistautumattomilla päätepisteillä. Yhtä yritystä vastaan hyökättiin, koska sen nimi vastasi arvioinnissa käytettyä kuvitteellista nimeä. Huolestuttavin tapaus liittyi siihen, että Claude latasi haittaohjelmapaketin PyPI:hen monimutkaisen prosessin jälkeen tilin luomiseksi. Paketin asensi tietoturvayritys, joka rutiininomaisesti tarkistaa Python-paketit haittaohjelmien varalta, ja suoritettu koodi vei tunnistetiedot takaisin Claudelle. Muut automatisoidut skannerit poistivat paketin tuntia myöhemmin, mutta se oli jo ladattu ja suoritettu 15 oikeassa järjestelmässä. Nämä tapaukset korostavat kyberhyökkäysarviointien suorittamiseen liittyviä merkittäviä riskejä ja tarvetta seurata hiekkalaatikoita tarkasti.
Lähde: Simon Willison — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset