Nieuwe methode haalt verborgen redeneringen uit geavanceerde AI-modellen
OpenAI
Anthropic
Google/DeepMind
Moonshot AI
DeepSeek
Alibaba/Qwen
Onderzoekers hebben een manier gevonden om de verborgen redeneringen van geavanceerde AI-modellen te extraheren, wat mogelijk distillatie-aanvallen mogelijk maakt en privé-informatie onthult. Ze identificeerden het probleem bij modellen van OpenAI, Anthropic en Google, en ontdekten dat het Chinese model Kimi K3 opvallend vergelijkbare redeneringen produceert als Claude Opus en GPT-5.6, hoewel dit geen doorslaggevend bewijs van distillatie is. De bedrijven hebben de kwetsbaarheid verminderd maar niet volledig opgelost.
Computerwetenschappers, waaronder Alexander Panfilov van de Universiteit van Tübingen, hebben een methode ontdekt om de verborgen 'gedachtegang' van geavanceerde AI-modellen te achterhalen. De techniek maakt gebruik van het feit dat bedrijven kleinere, minder aangepaste modelvarianten aanbieden die dezelfde ontsleutelingssleutel delen, maar eerder geneigd zijn om hun interne redenering te onthullen. Door versleutelde redeneersporen aan deze kleinere modellen te voeden, konden de onderzoekers de redenering van grotere modellen blootleggen, wat mogelijk destillatieaanvallen mogelijk maakt en persoonlijke informatie zoals API-sleutels en wachtwoorden blootstelt. Ze ontdekten dat het Chinese model Kimi K3 van Moonshot AI opvallend vergelijkbare redeneringen produceerde als Claude Opus 4.8 en GPT-5.6 Sol, maar merkten op dat dit niet causaal aantoont dat er sprake is van destillatie. De kwetsbaarheid werd gemeld aan OpenAI, Anthropic en Google, die maatregelen hebben genomen, maar Panfilov zegt dat sommige redeneersporen nog steeds kunnen worden geëxtraheerd. Het probleem benadrukt het groeiende geopolitieke belang van destillatie, aangezien Chinese bedrijven worden beschuldigd van het kopiëren van Amerikaanse modellen, hoewel experts verdeeld zijn over de werkelijke impact ervan.
Bron: Wired AI —
origineel
