Мысли ИИ можно прочитать с помощью другого ИИ: внутри обнаруживаются пароли и ключи
Исследователи продемонстрировали атаку, которая расшифровывает скрытые следы рассуждений проприетарных больших языковых моделей от Anthropic, OpenAI и Google с помощью двух вызовов API, не атакуя целевую модель. Метод также показал, что публичные журналы агентов содержат сотни секретов, включая пароли и ключи, скрытые внутри зашифрованных блоков.
Восемь исследователей из ELLIS Institute Tübingen, Института Макса Планка по интеллектуальным системам (Max Planck Institute for Intelligent Systems), Tübingen AI Center, MATS и Snyk опубликовали 10 августа препринт, описывающий атаку на зашифрованные цепочки рассуждений (reasoning traces) моделей от Anthropic, OpenAI и Google. Атака работает так: зашифрованный блок, полученный от мощной модели
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
