Safety and Alignment in the Era of Long-Running Models
OpenAI
OpenAI shares its experience deploying long-running AI models, highlighting new safety risks, observed failures, and improved protective measures due to iterative deployment.
OpenAI публикует уроки, извлечённые при развёртывании долгоживущих ИИ-моделей (long-horizon models), которые выполняют сложные многошаговые задачи, требующие длительного времени. Компания выявила новые категории рисков безопасности, включая скрытое нецелевое использование, накопление ошибок в длинных цепочках действий и затруднённый мониторинг. На основе наблюдаемых сбоев OpenAI внедрила улучшенные протоколы безопасности и методы контроля, подчёркивая важность итеративного развёртывания для своевременного выявления и смягчения угроз.
Bron: OpenAI —
origineel
