Безопасность ИИ RSS

Anthropic рассказала, как сдерживает Claude: веб, код и совместная работа

Компания Anthropic опубликовала подробности о том, как она контролирует свою модель Claude в веб-, кодовых и рабочих средах. Основное внимание уделяется безопасности, предотвращению нежелательных действий и управлению поведением ИИ.

AnthropicAnthropic
Anthropic (GNews)24.07 · 04:02

Модель не виновата: разбор трёх громких ИИ-инцидентов из-за отсутствия архитектуры

Автор анализирует три ИИ-инцидента: Deloitte Australia опубликовал отчёт с выдуманными источниками, система Flock привела к задержанию журналиста из-за ошибки распознавания номера, а автономный агент удалил подписки клиентов. Во всех случаях ошибка оказалась не в модели, а в архитектуре системы вокруг неё.

AnthropicAnthropic OpenAIOpenAI
Habr — хаб ИИ24.07 · 04:01
Свежие новости