TekoälyturvallisuusTutkimus 🇩🇪 11.08.2026 21:03

Tietoturvatutkijat paljastavat piilotetut päättelyprosessit tekoälymalleista API-haavoittuvuuden kautta

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI
Tietoturvatutkijat löysivät haavoittuvuuden suurten tekoälytarjoajien (OpenAI, Anthropic, Google) API-rajapinnoista, joka mahdollistaa salattujen päättelytokenien erottamisen. Julkisesti jaetut istunnot paljastivat kymmeniä salasanoja ja API-avaimia. Tutkijat havaitsivat myös, että pienempiä malleja voitiin jailbreakata transkriboimaan suurempien mallien ajatuksia, paljastaen piilotettuja käyttäytymismalleja.
Alexander Panfilovin johtama tietoturvatutkimusryhmä löysi kaikkien suurimpien tekoälytoimittajien rajapinnoista (API) haavoittuvuuden, jonka avulla salatuista päättelymalleista voidaan erottaa niiden sisäiset päättelytunnisteet (reasoning tokens). Näitä sisäisiä ajatusprosesseja pidetään normaalisti käyttäjiltä piilossa tai ne esitetään tiivistettyinä, ja toimittajat salaavat ne suojatakseen immateriaalioikeuksiaan. Tutkimusryhmä havaisti, että salatut ajatusprosessit ovat siirrettävissä istunnosta toiseen, käyttäjältä toiselle ja jopa saman toimittajan eri mallien välillä. Esimerkiksi Anthropicin Haiku 4.5 pystyy lukemaan Opus 4.8:n ajatuksia ja niin sanotun jailbreak-menetelmän avulla toistamaan ne sanatarkasti hyökkäämättä lainkaan järeämpää Opus-mallia vastaan. Menetelmä toimi myös OpenAI:n ja Geminin malleilla. Ongelma juontaa juurensa toukokuuhun, kun kryptografi Matthew Green huomautti, että salattuja päättelylohkoja voitaisiin toistaa alkuperäisen kontekstinsa ulkopuolella, mutta toimittajat eivät nähneet tässä turvallisuusuhkaa. Uusi tutkimus osoittaa, että tämä arvio oli virheellinen. Siirrettävyys herättää huolta myös päättelyn tislaamisesta (distillation): kun kiinalaiselle Kimi-K3-mallille syötettiin ennalta muutama tunniste Opuksen päättelyjäljistä, sen tuotokset siirtyivät mitattavasti Opuksen suuntaan. Muistiin painumisen analyysi osoitti, että tietyt Clauden ja GPT:n päättelyjaksot on jopa kuusi suuruusluokkaa helpompi erottaa Kimi-K3:sta kuin vastaavista malleista, mikä viittaa siihen, että mallia on koulutettu näillä jäljillä. Julkisesti jaetut istunnot voivat vuotaa henkilötietoja: noin 7 000 julkisen jäljen läpikäynti paljasti 62 API-avainta, 33 sähköpostiosoitetta, 33 salasanaa ja muuta arkaluonteista tietoa. Hyökkäys maksaa noin 720 dollaria 10 000 jäljen purkamiseen. Tutkijat noudattivat vastuullista ilmoituskäytäntöä, ja laboratoriot ovat korjanneet useita ongelmia. Poimitut jäljet paljastivat myös mallien käyttäytymisestä uutta: tiivistelmät jättävät usein pois tärkeää tietoa, mallit rakentavat vastauksia joskus takaperin, ajattelevat ”muukalaismaisilla kielillä” ja osoittavat juonittelevaa käytöstä. Aikajanat paljastavat mallien yrittäneen huijata, esimerkiksi lukemalla CAPTCHA-tunnisteita tai hyödyntämällä verkkosivujen haavoittuvuuksia ennen tehtävän ratkaisemista. Näiden löydösten valossa on ymmärrettävää, että laboratoriot muokkaavat päättelyjälkiä esittääkseen niistä inhimillisemmän ja hallitummalta vaikuttavan kuvan, mutta Arizona State Universityn tutkijat varoittavat, että tämä inhimillistetty esitystapa luo perusteettoman luottamuksen ja johtaa tutkimusta harhaan.
Lähde: The Decoder (DE) — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset