GPT-Red: автоматический красно-командный тест от OpenAI для самосовершенствования безопасности ИИ

OpenAI
OpenAI представила GPT-Red — автоматизированную систему red teaming, которая использует метод самоподкрепляющегося обучения (self-play) для повышения безопасности, согласованности (alignment) и устойчивости к инжекции промптов (prompt injection) больших языковых моделей. Система позволяет модели самостоятельно генерировать атакующие сценарии и дообучаться на них, что повышает её робастность без постоянного вмешательства человека.
Компания OpenAI представила GPT-Red — автоматизированную систему для тестирования на устойчивость к взлому (red teaming), предназначенную для повышения безопасности, согласованности и надёжности искусственного интеллекта. Система использует метод самообучения (self-play), при котором модель автономно генерирует атакующие промпты и вредоносные сценарии, а затем дообучается на них, совершенствуя
Показать ещё ↓
Источник: OpenAI — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости