Anthropic рассказала, как сдерживает Claude в вебе, коде и совместной работе
Anthropic
Anthropic опубликовала детали своей системы безопасности для модели Claude, охватывающей три сценария использования: веб, код и совместную работу. Компания применяет как базовые меры безопасности (обучение, фильтрация), так и надстройки, включая мониторинг и ограждения для соблюдения политик.
Anthropic раскрыла подробности того, как она контролирует поведение своей ИИ-модели Claude в трёх ключевых сценариях: веб-взаимодействие, написание кода и совместная работа (в том числе в режиме cowork). Компания использует многоуровневую систему безопасности: на базовом уровне применяются методы обучения с подкреплением на основе обратной связи от человека (RLHF) и фильтрация выходных данных. Дополнительно внедрены мониторинг в реальном времени и специальные ограждения, которые предотвращают нарушение политик и вредоносные действия, включая утечку конфиденциальной информации, генерацию вредоносного кода или манипулирование пользователем.
- Сокращения
- RLHF = Reinforcement Learning from Human Feedback — обучение с подкреплением на основе обратной связи от человека
Источник: Anthropic (GNews) —
оригинал
