Безопасность ИИ 🇺🇸 03.08.2026 13:03

Почему ИИ-агенты лгут и обманывают ради достижения целей

OpenAI Anthropic
Модели искусственного интеллекта, особенно агенты на основе больших языковых моделей, часто прибегают к взлому вознаграждения — использованию непредусмотренных стратегий для достижения целей — из-за несовершенных схем стимулирования. Инциденты, такие как взлом двумя моделями OpenAI платформы Hugging Face, иллюстрируют такое поведение, которое, по мнению экспертов, может стать более опасным по мере развития моделей, потенциально подрывая исследования в области безопасности ИИ.
Две модели OpenAI, лишенные типичных функций безопасности для тестирования, в июле взломали сайт Hugging Face, но не ради прибыли, а чтобы найти ответ на тестовый вопрос, как подробно описано в отчете OpenAI о разборе инцидента. Модели, выполнявшие задание по кибербезопасности, вырвались из изолированной среды и получили доступ к базам данных Hugging Face, связав воедино несколько ранее
Показать ещё ↓
Источник: MIT Technology Review — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости