エージェントアプリケーション 🇷🇺 11.08.2026 16:02

ニューラルネットワークがトークンを消費する理由:長いチャットで何が起こり、コストを削減する方法

AnthropicAnthropic SYNTX.AISYNTX.AI
長いAIチャットは、巨大なコンテキストウィンドウによりトークンコストを増加させ、モデルのパフォーマンスを低下させる可能性があります。RedditユーザーはClaudeで10億以上の入力トークンを消費したと報告し、別のユーザーは放置したAIエージェントで約6000ドルの費用を計上しました。「Context Rot」などの研究は、コンテキストが増えるにつれてパフォーマンスが低下することを示しており、専門家はタスクの分割、履歴の圧縮、プロンプトキャッシングの使用による節約を推奨しています。
この記事では、AIモデルが長いチャットでトークンを過剰に消費する理由と、そのコストを削減する方法について論じています。Redditでの逸話を引用しており、あるユーザーはClaudeで11億5千600万入力トークンを使い果たし、別のユーザーは30分ごとにプルリクエストをチェックするClaude Codeエージェントを26時間停止し忘れ、合計46回実行され、約6,000ドルの費用がかかりました。高いコストの技術的な理由は、新しいリクエストごとに蓄積されたすべてのコンテキスト(最大80万トークンに達することもある)が含まれるためです。Anthropicはドキュメントで、コンテキストサイズに応じてコストが増加することを警告し、履歴のクリアや圧縮を推奨しています。Chromaの研究(「コンテキストロット」)と2026年の研究(「コンテキストロットの診断と緩和」)では、コンテキストウィンドウの制限前であっても、入力が長くなるとパフォーマンスが低下し、特に無関係な情報がある場合に顕著であることが示されています。プロンプトキャッシングは、繰り返されるプレフィックスのコストを削減するだけであり、不要なコンテキストの問題は解決しません。AIエージェントの場合、コストはツール操作を自律的に多く実行するため、隠れています。実用的なヒントとしては、独立したタスクを分割すること、Claude Codeで「/clear」と「/compact」を使用すること、関連するドキュメントセクションのみを提供すること、安定した指示をキャッシュすること、適切なモデル階層(コーディングにはSonnet、複雑な推論にはOpus、単純なサブエージェントタスクにはHaiku)を選択することが挙げられます。著者はまた、SYNTX.AIのLLMスタジオを宣伝しており、100以上のAIモデルとダイアログ内でのモデル切り替え機能を提供し、プロモコード「CTRLAI」で20%割引が受けられます。この記事は、プロンプトエンジニアリングには現在、不要な情報の破棄が含まれなければならないと結論づけています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース