AgentCore Gateway unterstützt jetzt Rate Limiting für KI-Datenverkehr
Amazon Web Services
Anthropic
OpenAI
Das Amazon Bedrock AgentCore Gateway, ein vollständig verwaltetes serverloses KI-Gateway, unterstützt jetzt Rate Limiting für KI-Datenverkehr. Diese Funktion bietet eine feinkörnige Kontrolle über den Datenverkehr pro Benutzer, einschließlich Anfragenratenlimits (Anfragen pro Sekunde bzw. pro Minute), Tokenratenlimits (Token pro Minute) und Verbindungsratenlimits (Verbindungen pro Sekunde). Das Gateway unterstützt kundendefinierte Limits und Servicekontingente, mit Dimensionsschlüsseln wie targetName, toolName, qualifiedModelId und Identitätsansprüchen für eine flexible Konfiguration.
Das Amazon Bedrock AgentCore Gateway, ein vollständig verwaltetes, serverloses KI-Gateway, das einen einzigen sicheren Einstiegspunkt für KI-Datenverkehr bietet, unterstützt nun Ratenbegrenzung. Dies ermöglicht eine granulare Kontrolle darüber, wie viel Datenverkehr einzelne Benutzer über das Gateway verbrauchen können. Die Ratenbegrenzung bietet eine benutzerbezogene Kontrolle über die Nutzung von Tools, Inferenzmodellen und Agenten, mit OAuth- oder IAM-basierten Regeln für Anfragen pro Minute, gleichzeitige Verbindungen und Token-Durchsatz. Das Gateway unterstützt drei Zieltypen: MCP-Ziele, Inferenzziele und HTTP-Passthrough-Ziele. Unterstützte Ratenbegrenzungsmetriken umfassen Anfragenratengrenzen (Anfragen pro Sekunde/Anfragen pro Minute) für alle Ziele, Tokenratengrenzen (Token pro Minute) für Inferenzziele und Verbindungsratengrenzen (Verbindungen pro Sekunde) für alle Ziele. Dimensionsschlüssel definieren, wie Datenverkehr in Raten-Buckets gruppiert wird, einschließlich Zielname, Toolname, qualifizierte Modell-ID und Identitätsansprüche wie JWT-Ansprüche und IAM-Prinzipale. Einträge geben den zulässigen Durchsatz pro Bucket an, mit Unterstützung für Wildcards. Zwei Ebenen der Ratenbegrenzung werden durchgesetzt: kundendefinierte Grenzen und Kontingente. Kundendefinierte Grenzen umfassen Benutzerebene, Zielebene und hybride Ziel-Benutzer-Ebene. Eine Beispielkonfiguration zeigt Grenzen pro Gruppe und pro Benutzer für Basis-, Fortgeschrittenen- und Beta-Benutzergruppen, mit eingeschränkten Modellen für Beta-Benutzer.
Quelle: AWS ML blog —
Original
