построили конвейер оценки, который снизил долю неверных результатов с 1 из 8 до 1 из 50 запросов и сократил время обнаружения проблем с нескольких часов до нескольких минут. Конвейер включает двухфазную стратегию: тестирование во время сборки с помощью библиотеки strands-agents-evals и мониторинг в продакшене с Amazon Bedrock AgentCore Evaluations. Оценка проводится по трем уровням: использование инструментов (порог >95%), логика рассуждений (>85%) и качество вывода (>90%). Для борьбы с недетерминированностью LLM применяется метрика pass^k — вероятность успешного прохождения k последовательных попыток. Конвейер включает пять этапов развертывания с качественными воротами. В репозитории-компаньоне предоставлен развертываемый шаблон, адаптируемый под других агентов.