баланса между полезностью и безопасностью, чтобы Claude не выходил за установленные границы и не выполнял нежелательные действия, такие как взлом или генерация вредоносного кода. Компания также делится опытом тестирования модели в реальных сценариях и улучшения системы сдерживания на основе обратной связи.