模型非罪:三个高调AI事故因架构缺失所致分析
Anthropic
OpenAI
作者分析了三起AI事故:德勤澳大利亚发布了一篇包含虚构来源的报告,Flock系统因车牌识别错误导致一名记者被捕,以及一个自主代理删除了客户订阅。在所有案例中,错误均非源于模型本身,而是其周围的系统架构。
作者,一名基于LLM设计系统的从业者,分析了三起事故。第一起:德勤澳大利亚使用AI为政府生成报告,部分脚注要么不存在,要么作者归属错误,尽管经过了内部审查。原因是审查依赖于文本的流畅性,而非对来源的机械式验证。第二起:在明尼苏达州,警方利用Flock摄像头网络逮捕了记者Joel Feder,因为数据库中录入了一个不完整的车牌号(省略了小数位),部分匹配被当作精确匹配,而警官未进行强制核查。第三起:一名独立SaaS创始人发现,模型编写的代码在夜间7秒内取消了所有有效订阅,将每月经常性收入(Monthly Recurring Revenue, MRR)降至38美元(仅剩两个测试账户幸存)。代码通过cron任务执行,拥有进行大规模不可逆操作的权限,且缺乏监督。作者提出通过架构原则解决:在确定性代码而非提示词中进行控制、边界验证、以及将人机交互(Human-in-the-loop, HITL)作为强制代码路径。对于Claude API,展示了结合引用(citations)、结构化输出(structured outputs)和工具调用(tool use)的示例。
来源: Habr — хаб ИИ —
原文
