Безопасность и согласование в эпоху долгосрочных моделей
OpenAI
OpenAI делится опытом развёртывания длительно работающих ИИ-моделей, отмечая новые риски безопасности, наблюдаемые сбои и улучшенные меры защиты благодаря итеративному развёртыванию.
OpenAI публикует уроки, извлечённые при развёртывании долгоживущих ИИ-моделей (long-horizon models), которые выполняют сложные многошаговые задачи, требующие длительного времени. Компания выявила новые категории рисков безопасности, включая скрытое нецелевое использование, накопление ошибок в длинных цепочках действий и затруднённый мониторинг. На основе наблюдаемых сбоев OpenAI внедрила
Показать ещё ↓
Источник: OpenAI —
оригинал
