에이전트애플리케이션 🇺🇸 01.08.2026 08:02

Amazon Bedrock AgentCore Observability로 프로덕션 에이전트 최적화

Amazon/AWSAmazon/AWS
이 AWS ML 블로그 게시물은 AI 에이전트가 프로덕션으로 전환된 후 발생하는 성능 및 메모리 문제를 다룹니다. Amazon Bedrock AgentCore Observability를 Amazon CloudWatch와 함께 사용하여 병목 현상과 메모리 누수를 식별하는 방법에 대한 지침을 제공하고, 모니터링 및 최적화를 위한 모범 사례를 제시합니다.
이 게시물은 AI 에이전트 디버깅 시리즈의 2부로, 제대로 작동하지만 성능이 저조한 에이전트에 초점을 맞춥니다. 시나리오 3은 성능 병목 현상을 다룹니다. 증상으로는 점진적인 지연 시간 증가, P95 응답 시간이 임계값을 초과하지만 오류율이 낮은 경우가 있습니다. 진단하려면 CloudWatch에서 높은 지연 시간의 호출을 쿼리하고, OpenTelemetry 추적을 통해 요청 타임라인을 분석하며, 메모리 검색 지연 시간(200ms 미만이어야 함)과 도구 호출 지연 시간을 확인합니다. 근본 원인으로는 느린 도구 실행, 과도한 토큰 생성, 순차적 처리가 있습니다. 수정 방법으로는 캐싱, 연결 풀링, 데이터베이스 인덱싱, 프롬프트 간결성 최적화, 독립적인 도구 호출의 병렬 실행이 있습니다. 시나리오 4는 장기 실행 세션의 메모리 문제를 다루며, 메모리 사용량이 무한정 증가하여 토큰 한도에 도달하고 세션 실패를 초래합니다. 이를 식별하려면 메모리 사용량이 많은 장기 세션을 쿼리하고, 메모리 추출 패턴을 검사하며, 추출 실패를 확인합니다. 근본 원인으로는 잘못된 설정이 있습니다. 수정 방법으로는 메모리 통합, 네임스페이스 템플릿, eventExpiryDuration 설정이 있습니다. 게시물은 프로덕션 모범 사례로 마무리됩니다: 포괄적인 계측, CloudWatch 알람, 대시보드, 그리고 사전 예방적 모니터링을 위한 AgentCore Evaluators 및 Insights 사용.
출처: AWS ML blog — 원문
관련 게시물 ↓
새로운 뉴스