Uusi menetelmä paljastaa huippumallien piilotetun päättelyn
OpenAI
Anthropic
Google/DeepMind
Moonshot AI
DeepSeek
Alibaba/Qwen
Tutkijat ovat löytäneet tavan paljastaa huipputason tekoälymallien piilotettu päättely, mikä voi mahdollistaa tislaushyökkäykset ja yksityisten tietojen vuotamisen. He tunnistivat ongelman OpenAI:n, Anthropicin ja Googlen malleissa ja havaitsivat, että kiinalainen malli Kimi K3 tuottaa hämmästyttävän samankaltaista päättelyä kuin Claude Opus ja GPT-5.6, vaikka tämä ei olekaan lopullinen todiste tislauksesta. Yritykset ovat lieventäneet haavoittuvuutta, mutta eivät ole korjanneet sitä täysin.
Tietojenkäsittelytieteilijät, mukaan lukien Alexander Panfilov Tübingenin yliopistosta, löysivät menetelmän edistyneimpien tekoälymallien piilotetun 'ajattelun' paljastamiseen. Tekniikka hyödyntää sitä, että yritykset tarjoavat pienempiä, vähemmän linjattuja malliversioita, jotka jakavat saman salausavaimen mutta ovat halukkaampia paljastamaan sisäisen päättelynsä. Syöttämällä salattuja päättelyjälkiä näille pienemmille malleille tutkijat pystyivät paljastamaan suurempien mallien päättelyn, mikä saattaa mahdollistaa tislaushyökkäykset ja paljastaa henkilökohtaisia tietoja, kuten ohjelmointirajapinta-avaimia ja salasanoja. He havaitsivat, että kiinalainen malli Kimi K3 Moonshot AI:lta tuotti huomattavan samankaltaista päättelyä kuin Claude Opus 4.8 ja GPT-5.6 Sol, mutta huomauttivat, että tämä ei kausaalisesti vahvista tislausta. Haavoittuvuudesta ilmoitettiin OpenAI:lle, Anthropicille ja Googlelle, jotka ovat ottaneet käyttöön lieventäviä toimenpiteitä, mutta Panfilovin mukaan osa päättelyjäljistä voidaan edelleen poimia. Asia korostaa tislauksen kasvavaa geopoliittista merkitystä, sillä kiinalaisyrityksiä on syytetty sen käyttämisestä yhdysvaltalaisten mallien kopiointiin, vaikka asiantuntijat ovat erimielisiä sen todellisesta vaikutuksesta.
Lähde: Wired AI —
Alkuperäinen
