에이전트애플리케이션 🇷🇺 02.08.2026 18:01

자율 AI 에이전트가 4개월간 프로덕션 로그를 모니터링: 알림 113건, 환각 2건, 3.5시간 만의 수정

MiniMaxMiniMax AnthropicAnthropic
자율 AI 에이전트가 84일 동안 프로덕션 로그를 모니터링하며 113건의 알림을 생성했고, 그중 중요한 수정 사항은 3.5시간 만에 병합되었습니다. 모델이 환각을 일으킨 두 건의 사례에도 불구하고, 팀은 검증 단계를 구현하여 잘못된 알림을 줄였습니다. 이 시스템은 자체 호스팅 런타임, Grafana Loki, 그리고 비용 효율적인 AI 모델을 사용하여 월 비용을 10달러 미만으로 유지합니다.
AI 에이전트가 AI를 사용해 음악, 사진, 비디오를 생성하는 Creatorry 플랫폼의 프로덕션 로그를 모니터링합니다. 시스템은 18개의 서비스로 구성되어 있으며, 하루에 약 30만 줄의 로그가 기록되고 그중 약 12,500개가 오류 또는 경고입니다. 에이전트는 30분마다 실행되어 Loki에서 최근 오류를 쿼리하고, 심각한 문제나 오류율의 큰 급증을 감지한 경우에만 텔레그램으로 알림을 보냅니다. 84일 동안 에이전트는 113개의 알림을 발행했으며, 그중 69개는 오류, 41개는 치명적 오류, 3개는 초기 항목으로 심각도 레이블이 누락되었습니다. 가장 영향력 있는 알림은 6월 1일 초에 치명적인 오류를 감지하여 3.5시간 내에 수정 사항이 병합되도록 했습니다. 에이전트는 또한 폴백 프로바이더가 사용되지 않고 있음을 드러낸 503 오류의 물결을 포착했습니다. 그러나 에이전트는 두 번 환각을 일으켰습니다. 한 번은 봇 토큰을 지어냈고, 다른 한 번은 오류 수를 부풀려 보고했습니다. 이를 방지하기 위해 팀은 별도의 모델이 다른 방법을 사용하여 오류를 다시 계산하는 검증 단계를 구현했고, 검증되지 않은 알림을 거부하기 위해 엄격한 비율 임계값 2.0을 설정했습니다. 에이전트는 처음에는 Claude Opus를 사용했지만, Opus의 장황함과 높은 비용으로 인해 MiniMax-M3로 다시 전환했습니다. 에이전트는 월 10달러 구독으로 월 약 4억 3500만 토큰을 소비하며, 대부분의 토큰은 캐시된 읽기에서 발생합니다. 팀은 로그가 신뢰할 수 없는 입력이므로 프롬프트 주입 안전성을 강조하지만, 에이전트는 읽기 전용 액세스 권한을 가지며 자체 텔레그램 채널로만 보냅니다. 전체적으로 시스템은 135일 동안 실행되었으며, 다양한 문제로 인해 약 한 달의 다운타임이 있었습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스