AgentCore Gateway Ahora Admite Límites de Tasa para el Tráfico de IA
Amazon Web Services
Anthropic
OpenAI
La puerta de enlace AgentCore de Amazon Bedrock, una puerta de enlace de IA serverless totalmente gestionada, ahora admite límites de tasa para el tráfico de IA. Esta funcionalidad proporciona un control detallado sobre el tráfico por usuario, incluyendo límites de tasa de solicitudes (RPS/RPM), límites de tasa de tokens (TPM) y límites de tasa de conexiones (CPS). La puerta de enlace admite límites definidos por el cliente y cuotas de servicio, con claves de dimensión como targetName, toolName, qualifiedModelId y declaraciones de identidad para una configuración flexible.
Amazon Bedrock AgentCore Gateway, una puerta de enlace de IA totalmente gestionada y sin servidor que proporciona un único punto de entrada seguro para el tráfico de IA, ahora admite limitación de velocidad. Esto permite un control granular sobre cuánto tráfico pueden consumir los usuarios individuales a través de la puerta de enlace. La limitación de velocidad ofrece control por usuario sobre el uso de herramientas, modelos de inferencia y agentes, con reglas basadas en OAuth o IAM para peticiones por minuto, conexiones concurrentes y rendimiento de tokens. La puerta de enlace admite tres tipos de destinos: destinos MCP, destinos de inferencia y destinos de paso HTTP. Las métricas de límite de velocidad admitidas incluyen límites de tasa de peticiones (RPS/RPM) para todos los destinos, límites de tasa de tokens (TPM) para destinos de inferencia y límites de tasa de conexiones (CPS) para todos los destinos. Las claves de dimensión definen cómo se agrupa el tráfico en cubos de velocidad, incluyendo targetName, toolName, qualifiedModelId y afirmaciones de identidad como afirmaciones JWT y principales de IAM. Las entradas especifican el rendimiento permitido por cubo, con soporte de comodines. Se aplican dos capas de limitación de velocidad: límites definidos por el cliente y cuotas de servicio. Los límites definidos por el cliente incluyen límites a nivel de usuario, a nivel de destino y límites híbridos de destino-usuario. Una configuración de ejemplo muestra límites por grupo y por usuario para los grupos de usuarios Básico, Avanzado y Beta, con modelos restringidos para usuarios Beta.
Fuente: AWS ML blog —
original
