Tekoälyturvallisuus 🇷🇺 11.08.2026 22:01

Clauden salattu päättelylohko: Tarkastelu allekirjoituksen sisään tavutasolla

AnthropicAnthropic
Habr-artikkeli tarkastelee Claude-mallien salattuja päättelylohkoja ja paljastaa, että 'signature'-kenttä on protobuf, joka vuotaa metadataa, kuten mallin tunnuksen ja organisaation UUID:n, selkokielisenä. Kirjoittaja osoittaa, että varsinainen päättely on AES-GCM-salattua, mutta sen pituus on pääteltävissä, ja metadata muodostaa yksityisyysriskin, jos lokit jaetaan.
Uusi Habr-artikkeli kertoo, kuinka suljettujen mallien piilotetut päättelyketjut voidaan paljastaa hyödyntämällä haavoittuvuutta: hyökkääjä ottaa vahvan mallin salatun lohkon, antaa sen saman toimittajan heikommalle sisarmallille ja pyytää sanatarkkaa kerrontaa, jolloin alkuperäiset ajatukset, mukaan lukien mahdollisesti vahingossa mukaan päätyneet salasanat tai avaimet, tulevat luetuiksi. Kirjoittaja paljastaa, että 'allekirjoitus'-kenttä, joka on liitetty jokaiseen Clauden ajattelulohkoon, ei ole läpinäkymätön: se on protobuf, joka voidaan jäsentää ilman avaimia. Sisällä vain varsinainen ajatteluteksti on salattu (AES-GCM, 16-tavuinen tagi), kun taas ulompi kirjekuori ja otsikko sisältävät metatietoja selkokielisinä. Otsikko sisältää mallin tunnuksen (esim. 'claude-opus-5'), lohkon tyypin ja versiosta 15 alkaen (heinäkuu 2026) myös käyttäjän ~/.claude.json-tiedostosta löytyvän organisaation UUID:n. Tämä metadata on suojattu MACilla, joten lohkoja ei voi peukaloida, mutta jos se päätyy lokeihin, se voi yhdistää käyttäjän organisaatioon ja mallin käyttöön. Kirjoittaja arvioi, että esipainetussa kuvatun haavoittuvuuden vaikutusta voi lieventää tämän metatiedon läsnäolo, mutta käytännön riskinä on, että salaamaton otsikko vuotaa arkaluonteista tietoa, kun agenttilokeja jaetaan.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset