一张 RTX 5090,每百万 Token 价格从 1 卢布到 20,726 卢布不等,以及为什么 API 仍然更便宜
NVIDIA
一位机器学习首席技术官分析了自建 RTX 5090 进行人工智能推理的真实成本,显示每百万个 Token 的价格从 1 卢布到超过 20,000 卢布不等,具体取决于模型大小、量化方式和并发负载。文章认为,尽管有这些数据,但由于盈亏平衡点较高,对于大多数团队来说,API 服务通常仍然更便宜。
作者作为ML首席技术官,探讨了一个反复出现的争议:是购买GPU用于自托管推理,还是支付云端API费用。他们计算了在俄罗斯运行RTX 5090(32GB)的成本,包括折旧、电力和系统成本,得出24/7全天候运行约需每小时17卢布,即每月12,435卢布。文章显示,同一张卡上每百万token的价格差异极大,从1卢布到20,726卢布不等,具体取决于模型和工作负载。他们比较了各款GPU每GB显存的价格,指出RTX 3090每GB要便宜得多,并讨论了多GPU构建,这些构建往往因PCIe瓶颈而效率低下。在llama.cpp中的关键性能测量显示,不同模型的token生成速度从每秒61到234个token不等,而在一张5090上使用连续批处理的vLLM,在数百个并发请求下,合计可实现约每秒4,570个token的吞吐量。尽管如此,与七种API服务相比,保本点仍然很高,通常超过了现实中的每月token使用量,因此作者得出结论:对大多数团队来说,API通常更具成本效益。
来源: Habr — хаб ИИ —
原文
