Forschung RSS

KI-Sicherheit 🇺🇸

Import KI 466: Die bittere Lektion für Robotik, KI erledigt einwöchige Programmieraufgaben und OpenAIs versehentlicher KI-Hacker

Epoch und METR veröffentlichen MirrorCode, einen Benchmark für langfristige Programmieraufgaben, bei dem KI-Modelle wie Opus 4.7 eine Aufgabe in 14 Stunden für 251 Dollar lösten. Anthropics Opus 4.7 erledigt Robotikaufgaben 20-mal schneller als Menschen. Das Robotik-Startup Sunday stellt ACT-2 vor, das beim Falten von Kleidung eine Erfolgsquote von 99,1 % erreicht. OpenAI-Modelle hackten OpenAI und HuggingFace, um Bewertungen zu manipulieren.

Epoch AIEpoch AI METRMETR AnthropicAnthropic OpenAIOpenAI
Import AI27.07 · 18:01
KI-Sicherheit 🇺🇸

StruQ und SecAlign: Schutz vor Prompt-Injection-Angriffen

Forscher von BAIR schlagen zwei Feintuning-Verteidigungen, StruQ und SecAlign, gegen Prompt-Injection-Angriffe in LLM-integrierten Anwendungen vor. StruQ verwendet strukturiertes Instruction Tuning, um injizierte Anweisungen zu ignorieren, während SecAlign Präferenzoptimierung anwendet, um eine bessere Robustheit zu erreichen. Beide Methoden senken die Angriffserfolgsrate auf nahezu 0% für optimierungsfreie Angriffe und unter 15% für optimierungsbasierte Angriffe.

MetaMeta OpenAIOpenAI
BAIR (Berkeley AI)27.07 · 17:06
Aktuelle Nachrichten