Tác tửPhần cứng & Suy luận 🇺🇸 14.08.2026 19:09

Xây dựng quy trình tác nhân với SageMaker AI và Bedrock AgentCore

Amazon Web ServicesAmazon Web Services AnthropicAnthropic Alibaba/QwenAlibaba/Qwen
Bài viết này trình bày cách kết hợp các điểm cuối tương thích OpenAI trên Amazon SageMaker AI với môi trường chạy Amazon Bedrock AgentCore để xây dựng hệ thống đa tác nhân. Nó hướng dẫn triển khai Qwen 3.5 9B trên SageMaker AI, tích hợp vào hệ thống đa tác nhân Strands Agents cùng với các mô hình trên Amazon Bedrock và đưa toàn bộ quy trình lên môi trường chạy Amazon Bedrock AgentCore. Trọng tâm là kỹ thuật tích hợp, bao gồm khả năng quan sát cấp token từ các điểm cuối SageMaker, điều mà Strands không cung cấp theo mặc định.
Một thách thức phổ biến khi xây dựng luồng công việc tác tử (agentic workflows) là kết hợp các mô hình nền tảng (foundation models) được quản lý với các mô hình tối ưu chi phí hoặc chuyên về lĩnh vực của riêng bạn mà không cần viết lại framework tác tử. Bài viết này chỉ cách kết hợp các điểm cuối tương thích OpenAI trên Amazon SageMaker AI với Amazon Bedrock AgentCore runtime và khả năng triển khai được quản lý của nó. Kiến trúc kết nối ba đường dẫn lưu trữ mô hình thông qua một container Amazon Bedrock AgentCore duy nhất: một tác tử điều phối (Claude Haiku 4.5 trên Bedrock) dùng để phân loại ý định và định tuyến, một tác tử ngân sách (Claude Sonnet 4.6 trên Bedrock) dùng để phân tích chi tiết ngân sách, và một tác tử phân tích tài chính (Qwen 3.5 9B trên Amazon SageMaker AI) dùng để phân tích cổ phiếu bằng cách gọi công cụ (tool-calling). Quá trình triển khai bao gồm các mã thông báo mang (bearer tokens) tự động làm mới cho các phiên chạy dài, sử dụng mô hình agents as tools của Strands Agents và triển khai thông qua bedrock-agentcore-starter-toolkit. Một thách thức quan trọng là Amazon Bedrock AgentCore runtime tự động tích hợp các tác tử bằng OpenTelemetry, nhưng các điểm cuối tương thích OpenAI của SageMaker không nhận được dữ liệu telemetry về mã thông báo tự động. Giải pháp bao gồm việc thủ công phát ra các khoảng gen_ai.chat bao quanh lệnh gọi tác tử SageMaker và trích xuất mức sử dụng mã thông báo từ AgentResult.metrics.accumulated_usage của Strands. Ngoài ra, cần phải đặt stream_options: {"include_usage": True} vì vLLM theo mặc định không bao gồm phần dữ liệu (chunk) về mức sử dụng trong các phản hồi phát trực tiếp (streaming responses). Bài viết cũng bao gồm cấu hình từng bước, ví dụ kết quả theo dõi (trace output), các bài học quan trọng và mở rộng mô hình này bằng các mô hình được tinh chỉnh tốt, kiểm thử A/B với các thành phần suy luận (inference components) và định tuyến theo chi phí.
Nguồn: AWS ML blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới