Agents 🇺🇸 06.08.2026 21:03

La passerelle AgentCore prend désormais en charge la limitation de débit pour le trafic IA

Amazon Web ServicesAmazon Web Services AnthropicAnthropic OpenAIOpenAI
La passerelle AgentCore d'Amazon Bedrock, une passerelle IA serverless entièrement gérée, prend désormais en charge la limitation de débit pour le trafic IA. Cette fonctionnalité offre un contrôle précis du trafic par utilisateur, notamment des limites de débit de requêtes (requêtes par seconde / requêtes par minute), des limites de débit de jetons (jetons par minute) et des limites de débit de connexions (connexions par seconde). La passerelle prend en charge les limites définies par le client et les quotas de service, avec des clés de dimension telles que targetName, toolName, qualifiedModelId et les revendications d'identité pour une configuration flexible.
La passerelle AgentCore d'Amazon Bedrock, une passerelle IA sans serveur entièrement gérée offrant un point d'entrée unique et sécurisé pour le trafic IA, prend désormais en charge la limitation de débit. Cela permet un contrôle fin de la quantité de trafic que chaque utilisateur peut consommer via la passerelle. La limitation de débit offre un contrôle par utilisateur sur l'utilisation des outils, des modèles d'inférence et des agents, avec des règles basées sur OAuth ou IAM pour les requêtes par minute, les connexions simultanées et le débit de jetons. La passerelle prend en charge trois types de cibles : les cibles MCP, les cibles d'inférence et les cibles de passage HTTP. Les métriques de limitation de débit prises en charge incluent les limites de débit de requêtes (RPS/RPM) pour toutes les cibles, les limites de débit de jetons (TPM) pour les cibles d'inférence et les limites de débit de connexions (CPS) pour toutes les cibles. Les clés de dimension définissent comment le trafic est regroupé en compartiments de débit, notamment targetName, toolName, qualifiedModelId et les revendications d'identité telles que les revendications JWT et les principes IAM. Les entrées spécifient le débit autorisé par compartiment, avec prise en charge des caractères génériques. Deux niveaux de limitation de débit sont appliqués : les limites définies par le client et les quotas de service. Les limites définies par le client comprennent les limites au niveau de l'utilisateur, au niveau de la cible et les limites hybrides cible-utilisateur. Un exemple de configuration montre des limites par groupe et par utilisateur pour les groupes d'utilisateurs Basic, Advanced et Beta, avec des modèles restreints pour les utilisateurs Beta.
Source: AWS ML blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches