에이전트연구 🇫🇷 10.08.2026 18:01

AI 에이전트: 오류를 병렬화하지 않고 작업을 병렬화하기

OpenAIOpenAI AnthropicAnthropic
Anthropic 연구자들이 포함된 연구에서 Horizon이라는 벤치마크를 도입하고 3,100개 이상의 에이전트 경로를 분석했습니다. 결과는 특정 작업 복잡성을 넘어서면 AI 에이전트 성능이 급격히 붕괴될 수 있으며, 실패의 72.5%가 프로세스 관련 위험에 기인한다는 것을 보여줍니다. Anthropic은 단계를 분할하는 대신 독립적인 프로젝트를 분할할 것을 권장합니다.
연구진이 Horizon이라는 벤치마크를 개발하고 웹, 운영체제, 데이터베이스, 임베디드 환경 등 다양한 환경에서 3,100개 이상의 에이전트 궤적을 분석했습니다. 실험에는 OpenAI와 Anthropic의 모델을 사용하는 에이전트가 포함되었습니다. 연구 결과, 성능은 작업이 길어짐에 따라 점진적으로 저하되지 않고 특정 임계값을 넘어서면 안정적으로 유지되다가 갑자기 붕괴할 수 있는 것으로 나타났습니다. 실패의 7가지 주요 범주가 식별되었으며, 이는 두 가지 계열로 분류됩니다: 프로세스 관련 위험과 연관된 실패가 72.5%, 에이전트 설계 위험과 연관된 실패가 27.5%입니다. Anthropic은 '컨텍스트 오염(context pollution)'이라고 불리는 현상을 강조하는데, 이는 누적된 중간 정보가 에이전트의 컨텍스트를 어지럽히고 판단을 저하시키는 현상입니다. 연구는 작업을 독립적인 하위 작업으로 분할하여 별도의 에이전트가 처리하는 것이 효과적이지만, 설계, 구현, 테스트와 같은 단계를 분할하는 것은 너무 많은 컨텍스트를 공유하여 전화 게임과 같은 정보 손실을 초래한다고 제안합니다. 경영진에게 네 가지 질문이 핵심입니다: 누가 결정을 내렸는지, 어떤 정보에 기반했는지, 어떤 비용이 들었는지, 그리고 실패한 단계 하나를 독립적으로 재실행할 수 있는지 여부입니다. 재실행 가능성이 없으면 사고가 모든 것을 다시 시작하게 하며, 부적절한 분할은 단일 에이전트보다 3배에서 10배 더 많은 비용을 초래할 수 있습니다.
출처: Le Monde Informatique — IA — 원문
관련 게시물 ↓
새로운 뉴스