$6000. Техническая причина такой дороговизны в том, что каждый новый запрос включает в себя весь накопленный контекст, который может разрастись до 800 тысяч токенов. Anthropic в своей документации прямо предупреждает: стоимость растёт вместе с размером контекста, и рекомендует периодически очищать историю или использовать компакцию (сжатие контекста). Исследования компании Chroma (работа «Context Rot», то есть «гниение контекста») и статья 2026 года («Diagnosing and Mitigating Context Rot», «Диагностика и устранение гниения контекста») показывают, что качество ответов модели падает по мере увеличения длины входных данных — причём это происходит задолго до достижения лимита окна контекста, особенно если в тексте присутствует «шум», отвлекающая информация. Кэширование промптов (prompt caching) снижает расходы только на повторяющиеся неизменные фрагменты запроса, но не решает саму проблему избыточного контекста. Для AI-агентов эта проблема особенно скрыта от глаз, поскольку они самостоятельно выполняют множество операций с инструментами, и стоимость накапливается незаметно. Среди практических советов — разбивать независимые задачи на отдельные диалоги, использовать команды /clear и /compact в Claude Code, передавать модели только релевантные разделы документов, а не документ целиком, кэшировать стабильные, неизменяемые инструкции и правильно выбирать уровень модели: Sonnet — для написания кода, Opus — для сложных рассуждений, Haiku — для простых задач вспомогательных агентов (субагентов). Автор также рекламирует LLM Studio от SYNTX.AI — сервис, предоставляющий доступ к более чем 100 AI-моделям и возможность переключаться между моделями прямо внутри одного диалога, с промокодом CTRLAI на скидку 20%.
Показать ещё ↓