智能体AI安全 🇷🇺 12.08.2026 00:02

我如何验证我的智能体集群真正实现自主运行

AnthropicAnthropic
一位运维AI智能体集群的运营者描述了如何构建一个验证框架以证明其智能体的自主性。他们将四个不变量定义为基于事件日志的纯函数,并在真实数据上运行。结果显示,虽然第二层风险得到了适当的人工审批把关,但独立验证几乎从未执行,这揭示了声明纪律与现实之间的差距。
一位非开发背景的AI代理舰队运营商,试图证明其四台机器在六周内进行谈判的舰队是真正自主的。他们定义了四个不变量(INV-1至INV-4)作为事件日志上的纯函数,以验证行为规则,例如在提交二级行动之前需要人工批准,以及在提交之前进行独立验证。通过对64个真实提案和317个事件运行这些检查,他们发现INV-1(二级行动的人工门控)通过率为100%,但INV-2(独立验证)仅通过7.7%,表明验证是建议性的而非强制性的。INV-3捕获了一个重复事件风暴错误,其中枢纽重复接受17次,而INV-4揭示了五次升级未经等待人工解决就提交的情形。该运营商透明地公布了这些结果,包括一个真实痕迹,展示了正确的人工审批流程,同时同一痕迹因验证由提交者完成而未能通过INV-2。他们还讨论了局限性、错误以及评估工具的开源代码。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻