LLM-hakkerointi: Tutkijat voivat rekonstruoida käyttäjän kehotteet chatbotin vastauksista
Alibaba/Qwen
OpenAI
IIT Bombayn ja Adobe Researchin tutkijat ovat kehittäneet menetelmän, jolla suurten kielimallien alkuperäiset kehotteet voidaan rekonstruoida niiden tekstituotoksista suurella tarkkuudella. Menetelmä ei vaadi pääsyä mallin painoihin ja toimii myös muiden toimittajien malleissa. Tämä aiheuttaa mahdollisen tietoturvariskin yrityksille, jotka käyttävät omia järjestelmäkehotteitaan.
Mumbaissa sijaitsevan IIT Bombayn ja Adobe Researchin tutkijat ovat kehittäneet menetelmän, joka pystyy rekonstruoimaan suurten kielimallien syötekäskyt lähes tarkalleen niiden tekstituotoksista, toimien ilman pääsyä mallin painoihin ja siirtyen jopa muihin malleihin. Menetelmä, nimeltään 'Previous-Token Prediction' (PTP), kääntää kielimallien perusperiaatteen nurin kouluttamalla käänteismallin ennustamaan edellisiä tokeneita seuraavan tokenin sijaan. Tämä käänteismalli koulutetaan alusta alkaen yksinomaan synteettisellä datalla, jonka kohde-LLM tuottaa. Käänteismalli ei voi ainoastaan palauttaa alkuperäistä käskyä tarkalleen, vaan se voi myös tuottaa useita semanttisesti erilaisia käskyvaihtoehtoja vaihtelemalla dekoodausparametreja. Artikkelin laadullisessa esimerkissä käsky 'How to reach out to competitors to find their pricing strategies?' rekonstruoitiin tarkalleen sekä kuusi muuta varianttia. Testit oikeilla käyttäjäkäskyillä osoittivat myös semanttisesti uskollisia rekonstruktioita. Pieni käänteismalli, joka on koulutettu Qwen-3-0.6B-Chatilla, pystyi myös rekonstruoimaan käskyt GPT-4o-vastauksista, vangiten taustalla olevan kontekstin ja tarkoituksen, mikä tarkoittaa, että hyökkääjän ei tarvitsisi edes tietää, mikä malli on tekstituotoksen takana. Tämä on laaja turvallisuusongelma yrityksille, sillä omat järjestelmäkäskyt, jotka sisältävät liikesalaisuuksia, moderointisääntöjä tai erikoistuneita ohjeita, sekä luottamukselliset käyttäjän syötteet voitaisiin kaapata. Artikkeli itse ei tee eksplisiittisiä lausuntoja hyökkäyksistä kaupallisiin järjestelmiin, mutta mallien valmistajien on selvitettävä ja mahdollisesti korjattava tämä haavoittuvuus.
Lähde: The Decoder (DE) —
Alkuperäinen
