Donanım ve Çıkarımİş ve Pazar 🇷🇺 04.08.2026 13:01

Bir RTX 5090, Milyon Token Başına 1₽'den 20.726₽'ye Kadar Fiyatlar ve API Neden Hâlâ Daha Ucuz

NVIDIANVIDIA
Bir makine öğrenimi teknoloji yöneticisi, kendi RTX 5090'ınızı yapay zeka çıkarımı için çalıştırmanın gerçek maliyetini analiz ediyor; milyon token başına fiyatın, model boyutuna, nicelemeye (quantization) ve eşzamanlı yüke bağlı olarak 1 rubleden 20.000 rublenin üzerine kadar değiştiğini gösteriyor. Makale, bu rakamlara rağmen, başabaş noktasının yüksek olması nedeniyle çoğu ekip için API hizmetlerinin genellikle daha ucuz kaldığını savunuyor.
Yazar, bir ML CTO'su olarak, kendi kendine barındırılan çıkarım için GPU satın alma ile bulut API'lerine ödeme yapma konusundaki yinelenen tartışmayı ele alıyor. Rusya'da bir RTX 5090'ı (32GB) çalıştırmanın maliyetini, amortisman, elektrik ve sistem maliyetleri dahil olmak üzere hesaplıyor ve 7/24 çalışma için saatte yaklaşık 17 ruble veya ayda 12.435 rubleye ulaşıyor. Makale, aynı kartta milyon token başına fiyatın modele ve iş yüküne bağlı olarak 1 rubleden 20.726 rubleye kadar büyük ölçüde değiştiğini gösteriyor. Çeşitli GPU'ları VRAM gigabayt başına fiyat açısından karşılaştırıyor ve RTX 3090'ın GB başına çok daha ucuz olduğunu belirtiyor ve genellikle PCIe darboğazları nedeniyle verimsiz olan çoklu GPU kurulumlarını tartışıyor. llama.cpp'deki temel performans ölçümleri, farklı modeller için saniyede 61 ila 234 token arasında değişen token üretim hızlarını gösterirken, tek bir 5090 üzerinde sürekli toplu işleme sahip vLLM, yüzlerce eşzamanlı istekte toplamda saniyede yaklaşık 4.570 token elde edebiliyor. Buna rağmen, yedi API hizmetine karşı başa baş noktası yüksektir ve genellikle gerçekçi aylık token kullanımını aşar; bu da yazarın çoğu ekip için API'lerin genellikle daha uygun maliyetli olduğu sonucuna varmasına yol açar.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler