AI-veiligheid 🇷🇺 11.08.2026 21:02

AI-gedachten zijn te lezen met behulp van een andere AI, waardoor wachtwoorden en sleutels zichtbaar worden

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Onderzoekers hebben een aanval gedemonstreerd die de verborgen redeneersporen van propriëtaire grote taalmodellen van Anthropic, OpenAI en Google ontsleutelt met behulp van twee API-aanroepen, zonder het doelmodel aan te vallen. De methode ontdekte ook dat openbare agentlogs honderden geheimen bevatten, waaronder wachtwoorden en sleutels, verborgen in versleutelde blokken.
Acht onderzoekers van het ELLIS Instituut Tübingen, het Max Planck Instituut voor Intelligente Systemen, Tübingen AI Center, MATS en Snyk publiceerden op 10 augustus een preprint waarin ze een aanval beschrijven op de versleutelde redeneertraces van modellen van Anthropic, OpenAI en Google. De aanval werkt door het versleutelde blok van een sterk model (bijvoorbeeld Claude Opus 4.8) te nemen en dit te voeden aan een zwakker model van dezelfde aanbieder (bijvoorbeeld Haiku 4.5), dat vervolgens wordt gevraagd om de redenering woordelijk te herschrijven, waardoor deze wordt ontsleuteld. De aanval kraakt de versleuteling niet en valt het sterke model niet aan; het maakt misbruik van het feit dat het versleutelde blok naar de client wordt teruggestuurd en bij het volgende verzoek opnieuw moet worden meegestuurd. De onderzoekers verifieerden de authenticiteit van de ontsleutelde traces op 120 Codeforces-taken. Ze scanden ook 6708 openbare agentlogs van GitHub en Hugging Face en herstelden 315.320 redeneerblokken, die 704 unieke geheimen bevatten, waaronder 62 API-sleutels, 33 wachtwoorden, 24 toegangstokens, plus e-mailadressen, namen en interne URL's. Opmerkelijk is dat 64 van deze geheimen nergens in de zichtbare sessie voorkwamen en alleen in de versleutelde blokken bestonden. Het artikel beschrijft ook een vergiftigingsvector waarbij een kwaadaardig blok kan worden geplaatst om instructies te injecteren in een agent die het later laadt. De auteurs stellen cryptografische en systeemmaatregelen voor om het blok te binden aan de sessie, gebruiker en model, maar voorlopig moeten gebruikers versleutelde redeneerblokken als geheimen behandelen en voorkomen dat ze logs openbaar delen.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws