Perangkat Keras & InferensiBisnis & Pasar 🇷🇺 04.08.2026 13:01

Satu RTX 5090, Harga dari 1₽ hingga 20.726₽ per Juta Token, dan Mengapa API Masih Lebih Murah

NVIDIANVIDIA
Seorang CTO ML menguraikan biaya sebenarnya menjalankan RTX 5090 milik sendiri untuk inferensi AI, menunjukkan bahwa harga per juta token bervariasi dari 1 rubel hingga lebih dari 20.000 rubel tergantung pada ukuran model, kuantisasi, dan beban konkuren. Artikel tersebut berpendapat bahwa meskipun dengan angka-angka tersebut, layanan API seringkali tetap lebih murah bagi sebagian besar tim karena titik impasnya tinggi.
Penulis, seorang CTO ML, menanggapi perdebatan yang berulang tentang membeli GPU untuk inferensi yang di-host sendiri versus membayar API cloud. Mereka menghitung biaya menjalankan RTX 5090 (32GB) di Rusia, termasuk amortisasi, listrik, dan biaya sistem, yang mencapai sekitar 17 rubel per jam atau 12.435 rubel per bulan untuk operasi 24/7. Artikel ini menunjukkan bahwa harga per juta token pada kartu yang sama bervariasi secara liar dari 1 rubel hingga 20.726 rubel tergantung pada model dan beban kerja. Mereka membandingkan berbagai GPU berdasarkan harga per gigabyte VRAM, mencatat bahwa RTX 3090 jauh lebih murah per GB, dan membahas build multi-GPU, yang seringkali tidak efisien karena hambatan PCIe. Pengukuran kinerja utama di llama.cpp menunjukkan kecepatan generasi token mulai dari 61 hingga 234 token per detik untuk berbagai model, sementara vLLM dengan batching berkelanjutan pada satu 5090 dapat mencapai sekitar 4.570 token per detik gabungan di seluruh ratusan permintaan bersamaan. Meskipun demikian, titik impas terhadap tujuh layanan API tinggi, seringkali melebihi penggunaan token bulanan yang realistis, yang mengarahkan penulis pada kesimpulan bahwa API biasanya lebih hemat biaya untuk sebagian besar tim.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru