Первоначальная гипотеза заключалась в длинной истории диалога, но в реальном проблемном диалоге было всего два сообщения общим объемом 530 символов. Измерения показали, что контекст на шаг составлял 13 900 токенов, а при 9 шагах общий объем достигал примерно 120 000 токенов; накладные расходы умножались на количество шагов в цикле агента. Кроме того, провайдер резервирует худший случай стоимости с высоким значением max_tokens, что приводило к ошибкам HTTP 402 даже при достаточном балансе. Исправление заключалось в переносе предварительно загруженного контекста в инструменты по требованию, использовании бюджета на символы с приоритетами и явными маркерами обрезки, а также в прозрачности ожиданий по скорости. В статье подчеркивается, что контекст никогда не должен скрываться от модели молча, и что оптимизации следует проверять на конкретных случаях, так как они чуть не оптимизировали сценарий, где история не имела значения.