Jahres-AI-Paper: Anti-Destillationsmechanismen der drei führenden Modelle geknackt, kleine Modelle extrahieren verborgene Denkketten, Kimi-K3-Rekurrenz-Anomalie
Moonshot AI
Ein neues akademisches Paper behauptet, die Anti-Destillationsmechanismen der drei weltweit führenden KI-Modelle geknackt zu haben, sodass kleine Modelle verborgene Denkketten extrahieren können. Die Anomalie wurde mit Kimi-K3 reproduziert.
Ein jährlicher KI-Bericht dokumentiert einen umfassenden Durchbruch bei den Verteidigungsmechanismen gegen Modelldestillation von drei führenden KI-Modellen. Die Forscher zeigten, dass kleine Modelle effektiv die verborgenen Gedankenketten aus größeren Modellen extrahieren können, was die Schutzmaßnahmen untergräbt, die genau solche Extraktionen verhindern sollen. Das Phänomen wurde mit einer Wahrscheinlichkeitsanomalie bei Kimi-K3, einem Modell von Moonshot AI, reproduziert. Diese Entwicklung wirft Bedenken hinsichtlich der Sicherheit und des geistigen Eigentums fortschrittlicher KI-Systeme auf.
Quelle: Moonshot Kimi (GNews) —
Original
