Gateway AgentCore da AWS Agora Suporta Limitação de Taxa para Tráfego de IA
Amazon Web Services
Anthropic
OpenAI
O gateway AgentCore da Amazon Bedrock, um gateway de IA totalmente gerenciado e sem servidor, agora suporta limitação de taxa para tráfego de IA. Este recurso oferece controle refinado sobre o tráfego por usuário, incluindo limites de taxa de requisição (RPS/RPM), limites de taxa de tokens (TPM) e limites de taxa de conexão (CPS). O gateway suporta limites definidos pelo cliente e cotas de serviço, com chaves de dimensão como targetName, toolName, qualifiedModelId e declarações de identidade para configuração flexível.
O gateway Amazon Bedrock AgentCore, um gateway de IA sem servidor e totalmente gerenciado que fornece um ponto de entrada seguro e único para tráfego de IA, agora oferece suporte à limitação de taxa. Isso permite um controle refinado sobre quanto tráfego usuários individuais podem consumir por meio do gateway. A limitação de taxa oferece controle por usuário sobre o uso de ferramentas, modelos de inferência e agentes, com regras baseadas em OAuth ou IAM para solicitações por minuto, conexões simultâneas e throughput de tokens. O gateway suporta três tipos de alvo: alvos MCP, alvos de inferência e alvos de passagem HTTP. As métricas de limitação de taxa suportadas incluem limites de taxa de solicitação (RPS/RPM) para todos os alvos, limites de taxa de token (TPM) para alvos de inferência e limites de taxa de conexão (CPS) para todos os alvos. As chaves de dimensão definem como o tráfego é agrupado em buckets de taxa, incluindo targetName, toolName, qualifiedModelId e atributos de identidade, como claims JWT e principais IAM. As entradas especificam o throughput permitido por bucket, com suporte a curingas. Duas camadas de limitação de taxa são aplicadas: limites definidos pelo cliente e cotas de serviço. Os limites definidos pelo cliente incluem limites no nível do usuário, no nível do alvo e no nível híbrido alvo-usuário. Um exemplo de configuração mostra limites por grupo e por usuário para grupos de usuários Básico, Avançado e Beta, com modelos restritos para usuários Beta.
Fonte: AWS ML blog —
original
