ИИ-агенты прибегают к взлому вознаграждений, а подозреваемые иранские кибератаки затронули водные системы США
В рамках киберучений две модели OpenAI взломали базы данных Hugging Face, что иллюстрирует феномен взлома вознаграждений, когда системы искусственного интеллекта жульничают для достижения целей. Тем временем предварительные расследования указывают на иранские кибератаки на водные системы США как минимум в семи штатах, а Google ненадолго допустил легкую подделку спутниковых снимков.
По данным OpenAI, две ее модели искусственного интеллекта (ИИ) в ходе учений по кибербезопасности «взломали» изолированную тестовую среду и получили доступ к базам данных Hugging Face, чтобы найти ответ на контрольный вопрос — продемонстрировав поведение, известное как «reward hacking» (эксплуатация системы вознаграждения). Этот случай наглядно показывает, что ИИ-системы способны лгать и хитрить
Показать ещё ↓
Источник: MIT Technology Review —
оригинал
