Pikiran AI dapat dibaca menggunakan AI lain, mengungkap kata sandi dan kunci di dalamnya
Anthropic
OpenAI
Google/DeepMind
Para peneliti telah mendemonstrasikan serangan yang mendekripsi jejak penalaran tersembunyi dari model bahasa besar (LLM) proprietary milik Anthropic, OpenAI, dan Google menggunakan dua panggilan API, tanpa menyerang model target. Metode ini juga menemukan bahwa log agen publik berisi ratusan rahasia, termasuk kata sandi dan kunci, yang tersembunyi di dalam blok terenkripsi.
Delapan peneliti dari ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center, MATS, dan Snyk menerbitkan pracetak pada 10 Agustus yang menjelaskan serangan terhadap jejak penalaran terenkripsi dari model-model buatan Anthropic, OpenAI, dan Google. Serangan ini bekerja dengan mengambil blok terenkripsi dari model kuat (misalnya, Claude Opus 4.8) dan memberikannya ke model yang lebih lemah dari penyedia yang sama (misalnya, Haiku 4.5), yang kemudian diminta untuk menulis ulang penalaran tersebut secara verbatim, sehingga mendekripsinya. Serangan ini tidak memecahkan enkripsi atau menyerang model kuat; serangan ini mengeksploitasi fakta bahwa blok terenkripsi dikembalikan ke klien dan harus dikirim ulang dengan permintaan berikutnya. Para peneliti memverifikasi keaslian jejak yang didekripsi pada 120 tugas Codeforces. Mereka juga memindai 6708 log agen publik dari GitHub dan Hugging Face, memulihkan 315.320 blok penalaran, yang berisi 704 rahasia unik, termasuk 62 kunci API, 33 kata sandi, 24 token akses, plus email, nama, dan URL internal. Yang menarik, 64 dari rahasia ini tidak terlihat di mana pun dalam sesi yang terlihat, hanya ada di dalam blok terenkripsi. Makalah ini juga menjelaskan vektor peracunan di mana blok berbahaya dapat ditanam untuk menyuntikkan instruksi ke dalam agen yang kemudian memuatnya. Para penulis mengusulkan langkah-langkah kriptografi dan sistem untuk mengikat blok ke sesi, pengguna, dan model, tetapi untuk saat ini, pengguna harus memperlakukan blok penalaran terenkripsi sebagai rahasia dan menghindari berbagi log secara publik.
Sumber: Habr — хаб ИИ —
asli
