RTX 5090 하나로, 토큰 100만 개당 가격 1루블부터 20,726루블까지, 그리고 API가 여전히 더 저렴한 이유

NVIDIANVIDIA
한 ML 최고기술책임자(CTO)가 자체 RTX 5090을 사용한 AI 추론의 실제 비용을 분석하며, 모델 크기, 양자화, 동시 사용량에 따라 토큰 100만 개당 가격이 1루블에서 20,000루블 이상까지 다양하다는 것을 보여줍니다. 기사는 이러한 수치에도 불구하고 손익분기점이 높기 때문에 대부분의 팀에게 API 서비스가 여전히 더 저렴하다고 주장합니다.
저자는 ML CTO로서 자체 호스팅 추론을 위해 GPU를 구매할지, 아니면 클라우드 API 비용을 지불할지에 대한 반복적인 논쟁을 다룹니다. 러시아에서 RTX 5090(32GB)을 운영하는 비용을 감가상각, 전기요금, 시스템 비용 등을 포함해 계산하여, 24/7 운영 시 시간당 약 17루블, 월간 12,435루블에 달하는 것으로 결론을 내립니다. 기사는 동일한 카드에서 모델과 작업 부하에 따라 백만 토큰당 가격이 1루블에서 20,726루블까지 크게 변동함을 보여줍니다. 또한 VRAM 기가바이트당 가격으로 다양한 GPU를 비교하며, RTX 3090이 GB당 훨씬 저렴하다는 점을 강조하고, PCIe 병목 현상으로 인해 종종 비효율적인 멀티 GPU 구성에 대해 논의합니다. llama.cpp의 주요 성능 측정 결과, 다양한 모델에 대해 초당 61~234 토큰의 생성 속도를 보여주며, vLLM이 하나의 5090에서 연속 배치를 사용하여 수백 개의 동시 요청에 대해 총 초당 약 4,570 토큰을 달성할 수 있습니다. 그럼에도 불구하고, 일곱 가지 API 서비스에 대한 손익분기점은 높아서 현실적인 월간 토큰 사용량을 초과하는 경우가 많아, 저자는 대부분의 팀에게 API가 일반적으로 더 비용 효율적이라고 결론을 내립니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스