Tác tử 🇺🇸 06.08.2026 21:03

Cổng AgentCore hiện hỗ trợ giới hạn tốc độ cho lưu lượng AI

Amazon Web ServicesAmazon Web Services AnthropicAnthropic OpenAIOpenAI
Cổng AgentCore của Amazon Bedrock, một cổng AI không máy chủ được quản lý hoàn toàn, hiện hỗ trợ giới hạn tốc độ cho lưu lượng AI. Tính năng này cung cấp kiểm soát chi tiết đối với lưu lượng theo người dùng, bao gồm giới hạn tốc độ yêu cầu (RPS/RPM), giới hạn tốc độ token (TPM) và giới hạn tốc độ kết nối (CPS). Cổng hỗ trợ các giới hạn do khách hàng xác định và hạn mức dịch vụ, với các khóa chiều như targetName, toolName, qualifiedModelId và các khẳng định danh tính để cấu hình linh hoạt.
Amazon Bedrock AgentCore gateway, một cổng AI được quản lý hoàn toàn, không cần máy chủ (serverless), cung cấp một điểm truy cập an toàn duy nhất cho lưu lượng AI, hiện đã hỗ trợ giới hạn tốc độ (rate limiting). Tính năng này cho phép kiểm soát chi tiết lượng lưu lượng mà từng người dùng có thể sử dụng thông qua cổng. Giới hạn tốc độ mang lại khả năng kiểm soát theo từng người dùng đối với việc sử dụng công cụ, mô hình suy luận (inference model) và agent, với các quy tắc dựa trên OAuth hoặc IAM (Identity and Access Management) cho số lượng yêu cầu mỗi phút, số kết nối đồng thời và lưu lượng token. Cổng này hỗ trợ ba loại đích (target): đích MCP (Model Context Protocol), đích suy luận (inference target) và đích chuyển tiếp HTTP (HTTP passthrough target). Các chỉ số giới hạn tốc độ được hỗ trợ bao gồm giới hạn tốc độ yêu cầu (RPS/RPM - request per second/minute) cho tất cả các loại đích, giới hạn tốc độ token (TPM - token per minute) cho đích suy luận, và giới hạn tốc độ kết nối (CPS - connection per second) cho tất cả các loại đích. Các khóa chiều (dimension key) xác định cách lưu lượng được phân nhóm vào các nhóm giới hạn tốc độ (rate bucket), bao gồm targetName, toolName, qualifiedModelId, và các claim định danh như JWT (JSON Web Token) claim và principal IAM. Các mục (entry) quy định lưu lượng cho phép trên mỗi nhóm, có hỗ trợ ký tự đại diện (wildcard). Hai lớp giới hạn tốc độ được áp dụng: giới hạn do khách hàng tự định nghĩa và hạn mức dịch vụ (service quota). Giới hạn do khách hàng định nghĩa bao gồm giới hạn theo cấp người dùng, giới hạn theo cấp đích, và giới hạn kết hợp theo cấp đích-người dùng. Một ví dụ cấu hình minh họa giới hạn theo từng nhóm và từng người dùng cho các nhóm người dùng Basic, Advanced và Beta, trong đó nhóm Beta bị hạn chế quyền truy cập vào một số mô hình.
Nguồn: AWS ML blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới