Tekoälyn ajatuksia voidaan lukea toisen tekoälyn avulla, paljastaen salasanoja ja avaimia
Anthropic
OpenAI
Google/DeepMind
Tutkijat ovat osoittaneet hyökkäyksen, joka purkaa salaistetut päättelyjäljet suljetuista suurista kielimalleista, kuten Anthropicin, OpenAI:n ja Googlen malleista, käyttämällä kahta API-kutsua, ilman että kohdemallia hyökätään. Menetelmä paljasti myös, että julkiset agenttilokit sisältävät satoja salaisuuksia, kuten salasanoja ja avaimia, piilotettuna salattujen lohkojen sisään.
Kahdeksan tutkijaa ELLIS-instituutista Tübingenistä, Max Planck -instituutista (älykkäät järjestelmät), Tübingenin tekoälykeskuksesta, MATS:sta ja Snykistä julkaisi 10. elokuuta esipainoksen, jossa kuvataan hyökkäys Anthropicin, OpenAI:n ja Googlen mallien salattuja päättelyjälkiä vastaan. Hyökkäys toimii siten, että vahvan mallin (esim. Claude Opus 4.8) salattu lohko otetaan ja syötetään heikommalle mallille samalta palveluntarjoajalta (esim. Haiku 4.5), jota pyydetään kirjoittamaan päättely sana sanalta uudelleen, mikä paljastaa salauksen. Hyökkäys ei murra salausta eikä hyökkää vahvaa mallia vastaan; se hyödyntää sitä, että salattu lohko palautetaan asiakkaalle ja se on lähetettävä uudelleen seuraavan pyynnön yhteydessä. Tutkijat vahvistivat paljastettujen jälkien aitouden 120 Codeforces-tehtävässä. He myös skannasivat 6708 julkista agenttilokia GitHubista ja Hugging Facesta, joista löytyi 315 320 päättelylohkoa. Näissä oli 704 uniikkia salaisuutta, mukaan lukien 62 API-avainta, 33 salasanaa, 24 pääsytunnusta sekä sähköpostiosoitteita, nimiä ja sisäisiä URL-osoitteita. Huomionarvoista on, että 64 näistä salaisuuksista ei ollut näkyvissä missään näkyvässä istunnossa, vaan ne olivat olemassa vain salatuissa lohkoissa. Paperi kuvaa myös myrkytysvektorin, jossa haitallinen lohko voidaan istuttaa agenttiin, joka myöhemmin lataa sen, ja siten voidaan syöttää ohjeita agentille. Tekijät ehdottavat kryptografisia ja järjestelmätason toimenpiteitä lohkon sitomiseksi istuntoon, käyttäjään ja malliin, mutta toistaiseksi käyttäjien tulisi kohdella salattuja päättelylohkoja salaisuuksina ja välttää lokien jakamista julkisesti.
Lähde: Habr — хаб ИИ —
Alkuperäinen
