에이전트AI 안전 🇷🇺 28.07.2026 10:02

416개의 테스트와 '전체 삭제' 버튼: 에이전트 프로젝트가 실패하는 지점

AnthropicAnthropic
6개의 에이전트 프로젝트 분석 결과 반복되는 결함이 드러났습니다: 텍스트로서의 안전성, 게이트 없는 되돌릴 수 없는 행동, 제로 행동 테스트. 회귀 테스트를 갖춘 성숙한 오픈소스 프로젝트조차도 되돌릴 수 없는 이메일 전송에 대한 안전장치가 부족합니다. 저자는 에이전트 시스템 성숙도를 평가하기 위한 10가지 진단 질문을 제안합니다.
필자는 2026년 2월부터 Claude Code와 --dangerously-skip-permissions 플래그를 사용해 연구 루프에서 그라운드호그(수로크)라는 자율 에이전트를 운영해왔다. 이후 6개의 출처(예: Sber의 AI-DISRUPT PDLC 방법론 포함)로 구성된 종합 체크리스트를 바탕으로 자신의 에이전트 프로젝트 6개를 감사한 결과, 반복되는 세 가지 실패 패턴을 발견했다: 프롬프트에만 안전 조치가 강제되는 점(모델이 이를 무시할 수 있음), 확인 절차 없이 되돌릴 수 없는 작업이 수행되는 점(예: 재구축 명령이 모든 강화 데이터를 삭제), 행동 버그에 대한 회귀 테스트가 전혀 없는 점. 또한 필자는 익명의 대규모 오픈소스 에이전트 프로젝트를 검토했는데, 여기에는 코드 수준의 권한 확인 및 과거 버그에 대한 회귀 테스트가 있었지만 초안/확인 단계 없이 되돌릴 수 없게 이메일을 발송하는 문제가 여전히 존재했다. 새로운 오픈소스 프레임워크인 HarnessX는 인터럽트 온(interrupt_on) 게이트를 제공하지만 이는 선택 사항이며 기본값이 아니다. Sber의 PDLC 방법론은 누락된 통제 사항을 체계화한다: 정책을 코드로 관리, 평가를 완료 계약으로 간주, R0–R5 권한 계층 및 R3 이상의 상태 변경 작업에 대한 필수 중단/롤백 등. 필자는 배운 교훈을 일부 적용한 일곱 번째 프로젝트를 구축했으며, 이제 각 릴리스 전에 평가를 실행하고 장애 사례는 명명된 회귀 테스트로 전환된다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스