1ドルのエージェント:Hermes Agent+DeepSeek V4 Flashの経済学
DeepSeek
オープンソースのHermes AgentをDeepSeek V4 Flash上で使用し、わずか1ドル余りで数億トークンを処理したとするバイラルなスクリーンショットが話題となった。本記事では、この低コストの背後にある仕組み、特に自動プレフィックスキャッシングに焦点を当てて説明し、キャッシュを破壊する要因とベンダーの主張について概説する。
8月上旬、X上で、処理されたトークンが数億単位、請求額が1ドル強というダッシュボードのスクリーンショットが拡散された。これは、オープンなHermes AgentをDeepSeek V4 Flashモデルで使用した結果だと言われている。Nous ResearchがMITライセンスで開発したHermes Agentは、OpenAI互換のエンドポイントであればどれでも動作し、クローズドな学習ループを備えており、学習したスキルをマークダウンファイルに保存する。DeepSeek V4 Flashは、7月31日からパブリックベータ版が提供されており、4月のプレビュー版と同じアーキテクチャを採用しているが、ファインチューニングによりエージェント機能が向上している。主なコスト削減は、基本料金の低さではなく、自動プレフィックスキャッシュによるもので、繰り返されるプロンプトのプレフィックスは、数倍から数十倍低い料金で請求される。エージェントループはこの仕組みにほぼ完璧に適合しており、各呼び出しで同じシステムプロンプトと履歴が再送され、数行の新しい行が追加されるだけである。ただし、プロンプトのヘッダーにある要素(タイムスタンプ、セッションID、動的に並べ替えられたツールリストなど)が変更されると、節約効果は損なわれる。ベンダーは、小さいモデルがエージェントベンチマークで大きいプレビューモデルを上回ると主張しているが、高度な推論にはV4-Proの使用を推奨している。ピーク時の追加料金は発表されているがまだ有効ではなく、Proへのエスカレーションを伴うハイブリッドルーティングはキャッシュをリセットする。この記事では、料金レートを提供し、一般的なキャッシュ破壊要因をリストアップし、レート制限やセキュリティ境界などの計画および運用上の考慮事項についてアドバイスしている。
出典: Habr — хаб ИИ —
原文
