AI-veiligheid 🇷🇺 11.08.2026 22:01

Claude's gecodeerde redeneringsblok: een blik op bitniveau in de handtekening

AnthropicAnthropic
Een artikel op Habr onderzoekt de gecodeerde redeneringsblokken van Claude-modellen en onthult dat het veld 'handtekening' een protobuf is die metadata zoals model-ID en organisatie-UUID in platte tekst lekt. De auteur laat zien dat de daadwerkelijke redenering is gecodeerd met AES-GCM, maar dat de lengte ervan kan worden afgeleid, en dat de metadata een privacyrisico vormt als logs worden gedeeld.
Een nieuw artikel op Habr beschrijft hoe je verborgen redeneringen uit gesloten modellen kunt extraheren door misbruik te maken van een fout: een aanvaller neemt een versleuteld blok van een sterk model, geeft het aan een zwakker zustermodel van dezelfde aanbieder en vraagt om een letterlijke navertelling, waardoor de oorspronkelijke gedachten worden gelezen, inclusief eventueel per ongeluk opgenomen wachtwoorden of sleutels. De auteur onthult dat het 'handtekening'-veld dat aan elk Claude-denkblok is bevestigd niet ondoorzichtig is: het is een protobuf die zonder enige sleutels kan worden geparseerd. Van binnen is alleen de daadwerkelijke denktekst versleuteld (AES-GCM, met een tag van 16 bytes), terwijl de buitenste envelop en header metadata in leesbare tekst bevatten. De header bevat de modelidentificatie (bijvoorbeeld 'claude-opus-5'), het bloktype, en sinds versie 15 (juli 2026) de organisatie-UUID uit het ~/.claude.json-bestand van de gebruiker. Deze metadata wordt gedekt door een MAC, dus blokken kunnen niet worden gemanipuleerd, maar als ze in logs terechtkomen, kunnen ze een gebruiker koppelen aan hun organisatie en modelgebruik. De auteur suggereert dat de kwetsbaarheid die in de preprint wordt beschreven mogelijk wordt beperkt door de aanwezigheid van deze metadata, maar het praktische risico is dat de niet-versleutelde header gevoelige informatie lekt wanneer agentlogs worden gedeeld.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws