에이전트AI 안전 🇷🇺 12.08.2026 00:02

내 AI 에이전트 함대가 진정으로 자율적인지 검증한 방법

AnthropicAnthropic
AI 에이전트 함대를 운영하는 한 사용자가 에이전트의 자율성을 증명하기 위해 검증 하네스를 구축한 방법을 설명합니다. 그들은 네 가지 불변 조건을 이벤트 로그에 대한 순수 함수로 정의하고 실제 데이터에 적용했습니다. 결과는 2계층 위험이 인간 승인에 의해 적절히 게이트되었지만, 독립 검증은 거의 수행되지 않아 선언된 규율과 현실 사이의 격차를 드러냈습니다.
AI 에이전트 플릿 운영자(개발자 출신이 아님)는 6주 동안 협상을 실행한 4대의 머신으로 구성된 자사 플릿이 진정으로 자율적인지 입증하기 위해 나섰습니다. 그들은 이벤트 로그에 대한 순수 함수로 4개의 불변식(INV-1 ~ INV-4)을 정의하여, 티어-2 작업을 커밋하기 전에 인간의 승인이 필요하다거나 커밋 전에 독립적인 검증이 필요하다는 등의 행동 규칙을 검증했습니다. 64개의 실제 제안과 317개의 이벤트에 대해 이러한 검사를 실행한 결과, INV-1(티어-2에 대한 인간 게이트)은 100% 통과했지만 INV-2(독립 검증)는 7.7%만 통과하여 VERIFY가 권고 사항일 뿐 강제되지 않았음을 나타냈습니다. INV-3은 허브가 ACCEPT를 17번 반복한 중복 이벤트 스톰 버그를 포착했고, INV-4는 인간의 해결을 기다리지 않고 커밋된 5건의 에스컬레이션을 드러냈습니다. 운영자는 이러한 결과를 투명하게 공개했으며, 적절한 인간 승인 흐름과 동일한 추적이 커밋터가 검증을 수행했기 때문에 INV-2를 실패한 실제 추적을 모두 보여주었습니다. 또한 한계, 오류, 평가 하네스의 오픈 소스 코드에 대해서도 논의했습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스