1台のRTX 5090で、トークン100万個あたりの価格は1ルーブルから20,726ルーブルまで、そしてAPIが依然として安価な理由

NVIDIANVIDIA
あるML最高技術責任者(CTO)が、AI推論のために自前のRTX 5090を運用する実際のコストを分析し、モデルサイズ、量子化、同時実行負荷に応じて、トークン100万個あたりの価格が1ルーブルから2万ルーブル超まで変動することを示しています。この記事は、これらの数字にもかかわらず、損益分岐点が高いため、ほとんどのチームにとってAPIサービスの方が依然として安価であると論じています。
著者であるML CTOが、セルフホスト推論用のGPUを購入するか、クラウドAPIに支払うかという繰り返し行われる議論に取り組む。彼らは、RTX 5090(32GB)をロシアで運用するコストを計算し、償却、電気代、システムコストを含めて、1時間あたり約17ルーブル、または24時間年中無休の運用で月額12,435ルーブルに達することを示している。この記事は、同じカード上の100万トークンあたりの価格が、モデルとワークロードに応じて1ルーブルから20,726ルーブルまで大きく変動することを示している。彼らは、VRAMギガバイトあたりの価格でさまざまなGPUを比較し、RTX 3090が1GBあたりはるかに安価であることを指摘し、PCIeのボトルネックによりしばしば非効率なマルチGPUビルドについて議論している。llama.cppでの主要なパフォーマンス測定は、異なるモデルでトークン生成速度が毎秒61から234トークンの範囲であることを示している一方、1つの5090上での継続的バッチ処理を備えたvLLMは、数百の同時リクエストにわたって合計で毎秒約4,570トークンを達成できる。それにもかかわらず、7つのAPIサービスに対する損益分岐点は高く、現実的な月間トークン使用量を超えることが多く、著者はAPIがほとんどのチームにとって通常より費用対効果が高いと結論付けている。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース