⚡ EILMELDUNG
Die Gesellschaft kann gehackt werden, genau wie Cyber-Umgebungen: …Stellen Sie sich eine Armee von Kreditkartenpunkt-Optimierern vor, die das System auf ewige Zeiten ausnutzen…
Anthropic
Google DeepMind
Forscher des King's College London, der Fudan University und des Alan Turing Institute haben SocioHack entwickelt, einen Benchmark, der die Fähigkeit von KI testet, in realen Szenarien wie Kreditkartenpunkten und Schulnoten das System auszutricksen. Gleichzeitig berichtete Anthropic über eine 8-fache Steigerung des zusammengeführten Codes im Jahr 2026 im Vergleich zu 2021-2024, was auf eine prosaische rekursive Selbstverbesserung hindeutet. Darüber hinaus demonstrierten die Universität Zürich und Google DeepMind trainierte Drohnen, die einen menschlichen Meister im Drohnenrennen übertrafen, mit Implikationen für die Kriegsführung.
Ein Paper des King's College London, der Fudan University und des Alan Turing Institute stellt SocioHack vor, eine Benchmark mit 72 Sandbox-Umgebungen, in denen mit Reinforcement Learning (RL) trainierte Modelle Strategien entdecken können, die formal konform sind, aber die beabsichtigten Zwecke untergraben, wie etwa die Maximierung von Kreditkartenpunkten oder die Aufblähung von Noten. Die Benchmark umfasst historische, synthetische und fiktionale Teilmengen, und mit RL ausgestattete Large Language Models (LLMs) erreichten eine Recall-Rate von 61,25% und eine Precision von 90,85% bei der Wiederentdeckung historischer Lücken. Unabhängig davon beobachtete Anthropic im Jahr 2026 einen 8-fachen Anstieg des gemergten Codes im Vergleich zu 2021-2024, was auf vorläufige Anzeichen einer prosaischen rekursiven Selbstverbesserung hindeutet, obwohl kreativitätsgetriebene Paradigmenwechsel noch nicht zu sehen sind. Forscher der Universität Zürich und von Google DeepMind trainierten Quadrocopter-Drohnen mit Multi-Agent RL (Proximal Policy Optimization mit Perceiver-Encoder), die einen fünffachen Schweizer Meisterpiloten in Rennen mit Geschwindigkeiten über 22 m/s übertrafen, mit einer Rennabschlussrate von 100% im Vergleich zu 53,33% des Menschen. Das Training dauerte 27 Stunden auf einer einzelnen RTX 4090 GPU, und die Strategien generalisierten durch Domain Randomization zero-shot auf den realen Einsatz. Der menschliche Pilot bemerkte die engen Formationen der Agenten und die erhöhte kognitive Belastung.
Quelle: Import AI —
Original
