Amazon Bedrock AgentCore: Detecting Hidden AI Agent Failures
Amazon/AWS
Amazon Bedrock has launched AgentCore optimization, which identifies 'silent' failures of AI agents—behavior errors that are not captured by standard metrics (99% success, zero errors). The tool analyzes session traces, clusters failures (11 types, including hallucinations, incorrect actions), and indicates the root cause, offering prioritized fixes. Beyond failures, AgentCore shows the distribution of user intents and the actual strategies of the agent.
Amazon Bedrock представил оптимизацию AgentCore, предназначенную для обнаружения поведенческих сбоев ИИ-агентов, которые не видны стандартным мониторингом: система показывает 99% успеха, нулевую задержку и отсутствие ошибок, но клиенты жалуются на неверные результаты (например, невыполненное изменение заказа или пропущенный шаг согласования). AgentCore анализирует трассы сессий, собранные через CloudWatch, и структурирует сбои по таксономии из 11 категорий (галлюцинации, неверные действия, нарушение инструкций, ошибки оркестрации и т.д.), выявляя даже те, что не генерируют сигналов ошибки. Система кластеризует сбои по сотням сессий, определяет первопричину (например, выдумка финансовых данных без вызова инструментов) и ранжирует кластеры по доле затронутых сессий, чтобы разработчик мог сразу увидеть, какая проблема затрагивает 30% трафика, а какая — лишь три сессии. AgentCore также кластеризует запросы пользователей (показывая, сколько трафика приходится на целевые, частично поддерживаемые и непредусмотренные сценарии) и извлекает исполняемые сводки по каждой сессии, выявляя расхождения между ожидаемым и фактическим поведением агента. Настройка включает выбор типов анализа (сбои, намерения, исполнение), указание источника трасс (агент из AgentCore или напрямую CloudWatch) и расписание (однократное или регулярное). Пример: агент рыночных трендов в 1 из 10 сессий галлюцинировал данные о финансах, не используя инструменты; исправление — усиление системного промпта. Инсайты смещают модель наблюдаемости с реактивного просмотра трасс на проактивное обнаружение паттернов, позволяя исправлять наиболее критичные проблемы в первую очередь.
Bron: AWS ML blog —
origineel
