контент. Исследование подчеркивает, что, несмотря на значительные инвестиции в обучение безопасности, многие модели остаются уязвимыми к этим низкотехнологичным атакам. Эта уязвимость подчеркивает текущую проблему обеспечения надежного согласования в системах искусственного интеллекта.