Model Is Not to Blame: Analysis of Three High-Profile AI Incidents Due to Lack of Architecture
Anthropic
OpenAI
The author analyzes three AI incidents: Deloitte Australia published a report with fabricated sources, the Flock system led to the arrest of a journalist due to a license plate recognition error, and an autonomous agent deleted customer subscriptions. In all cases, the error was not in the model but in the system architecture surrounding it.
Автор, проектирующий системы на базе LLM, разбирает три инцидента. Первый: Deloitte Australia использовал ИИ для отчёта правительству, часть сносок оказалась несуществующей или приписанной не тем авторам, несмотря на внутренние ревью. Причина в том, что проверка полагалась на беглость текста, а не на механическую верификацию источников. Второй: в Миннесоте полиция с помощью сети камер Flock задержала журналиста Джоэла Федера из-за того, что в базу внесли неполный номер (опустили мелкие цифры), и частичное совпадение сработало как точное, без обязательной проверки офицером. Третий: основатель инди-SaaS обнаружил, что написанный моделью код ночью за 7 секунд отменил все активные подписки, сократив MRR до $38 (уцелели две тестовые). Код выполнялся по cron-задаче, у него были права на массовую необратимую операцию без контроля. Автор предлагает решения через архитектурные принципы: контроль в детерминированном коде, а не в промпте, валидация на границах и human-in-the-loop как обязательная ветка кода. Для Claude API показаны примеры с citations, structured outputs и tool use.
Bron: Habr — хаб ИИ —
origineel
