智能体应用 🇷🇺 02.08.2026 18:01

自主人工智能代理监控生产日志四个月:113条警报,2次幻觉,以及一个3.5小时的修复

MiniMaxMiniMax AnthropicAnthropic
一个自主人工智能代理已连续84天监控生产日志,产生113条警报,其中包含一次关键修复,在3.5小时内完成合并。尽管模型出现了两次幻觉,团队仍实施了验证步骤以减少误报。该系统采用自托管运行时、Grafana Loki以及高性价比的人工智能模型,将月度开销控制在10美元以下。
该AI代理监控着Creatorry平台的生产日志,该平台利用AI生成音乐、照片和视频。系统由18个服务组成,每天记录约30万行日志,其中约12500行是错误或警告。代理每30分钟运行一次,查询Loki以获取最近的错误,只有在检测到关键问题或错误率显著飙升时才会向Telegram发送警报。在84天里,代理共发出113条警报,其中错误69条,关键问题41条,另有3条早期记录缺少严重性标签。最具影响力的警报在6月1日早些时候检测到一个关键错误,导致在3.5小时内合并了一个修复方案。代理还捕捉到一波503错误,揭示了备用提供商未被使用。然而,代理有两次出现幻觉:一次是虚构了一个机器人令牌,另一次是报告了夸大的错误计数。为了应对这一问题,团队实施了一项验证步骤,即由另一个模型使用不同方法重新计数错误,并设置了严格的比率阈值2.0,以拒绝未经验证的警报。代理最初使用Claude Opus,但由于Opus的冗长和高成本,又切换回MiniMax-M3。代理每月在10美元的订阅下消耗约4.35亿个令牌,其中大部分令牌来自缓存读取。团队强调提示注入安全性,因为日志是不可信的输入,但代理只有只读权限,并且仅发送到他们自己的Telegram频道。总体而言,系统已运行135天,其中因各种问题约有1个月的停机时间。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻