Почему нейросети съедают токены: что происходит в длинных чатах и как сократить расходы
Длинные чаты с ИИ и огромные контекстные окна увеличивают расход токенов и могут ухудшать качество работы модели. Один пользователь Reddit сообщил, что потратил более миллиарда входных токенов с Claude, а другой накопил около 6000 долларов на беспилотном ИИ-агенте. Исследования, такие как «Контекстная гниль» (Context Rot), показывают, что производительность падает по мере роста контекста, и эксперты рекомендуют разбивать задачи, сжимать историю и использовать кэширование промптов для экономии.
В статье разбирается, почему AI-модели в длинных диалогах расходуют токены с такой скоростью и как на этом можно сэкономить. Приводятся истории с Reddit: один пользователь спалил 1,156 миллиарда входных токенов при работе с Claude, другой забыл остановить агента Claude Code, который каждые 30 минут в течение 26 часов проверял pull request'ы — в итоге набралось 46 запусков и счёт примерно на
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
