AgentCore Gateway Ondersteunt Nu Rate Limiting voor AI-verkeer
Amazon Web Services
Anthropic
OpenAI
De Amazon Bedrock AgentCore-gateway, een volledig beheerde serverloze AI-gateway, ondersteunt nu rate limiting voor AI-verkeer. Deze functie biedt fijnmazige controle over per-gebruiker verkeer, waaronder limieten voor aanvraagsnelheid (RPS/RPM), tokenlimieten (TPM) en verbindingsfrequentielimieten (CPS). De gateway ondersteunt door klanten gedefinieerde limieten en servicequota, met dimensiesleutels zoals targetName, toolName, qualifiedModelId en identiteitsclaims voor flexibele configuratie.
Amazon Bedrock AgentCore-gateway, een volledig beheerde, serverloze AI-gateway die één veilig toegangspunt biedt voor AI-verkeer, ondersteunt nu snelheidsbeperkingen. Dit maakt fijnmazige controle mogelijk over hoeveel verkeer individuele gebruikers via de gateway kunnen verbruiken. Snelheidsbeperkingen bieden per gebruiker controle over het gebruik van tools, inferentiemodellen en agents, met op OAuth of IAM gebaseerde regels voor aanvragen per minuut, gelijktijdige verbindingen en token-doorvoer. De gateway ondersteunt drie doelen: MCP-doelen, inferentiedoelen en HTTP-passthrough-doelen. Ondersteunde statistieken voor snelheidsbeperkingen omvatten limieten voor aanvragen per seconde of minuut (RPS/RPM) voor alle doelen, tokenlimieten per minuut (TPM) voor inferentiedoelen en verbindingslimieten per seconde (CPS) voor alle doelen. Dimensiesleutels definiëren hoe verkeer wordt gegroepeerd in snelheidsemmers, inclusief doelnaam, toolnaam, gekwalificeerd model-ID en identiteitsclaims zoals JWT-claims en IAM-principals. Invoer specificeert de toegestane doorvoer per emmer, met ondersteuning voor wildcards. Er worden twee lagen van snelheidsbeperkingen gehandhaafd: door de klant gedefinieerde limieten en servicequota. Door de klant gedefinieerde limieten omvatten limieten op gebruikersniveau, doelgroepniveau en hybride doelgroep-gebruikersniveau. Een voorbeeldconfiguratie toont limieten per groep en per gebruiker voor basis-, gevorderde- en bètagebruikersgroepen, met beperkte modellen voor bètagebruikers.
Bron: AWS ML blog —
origineel
