запросов в секунду, что приводит к ошибкам ThrottlingException. Авторы объясняют, что потребление измеряется в текстовых единицах (1 единица = 1000 символов), а количество единиц умножается на число активных защитных механизмов. В отличие от обычных диалогов, генерация кода характеризуется длинным выводом (тысячи символов), продолжительными сессиями и одновременной работой нескольких пользователей. Предлагается два ключевых архитектурных паттерна. Первый — модель «предкоммита»: вместо непрерывного сканирования каждого токена следует проверять границы доверия — входные данные пользователя, финальный артефакт кода и запись кода в файл/репозиторий, используя API ApplyGuardrail для точечной валидации. Второй — увеличение интервала потоковой оценки с 50 до 1000 символов, что позволяет сократить количество вызовов API в 20 раз. Эти оптимизации помогают избежать троттлинга, снизить затраты и повысить производительность при сохранении безопасности.