하드웨어 및 추론 🇷🇺 03.08.2026 18:02

DGX Spark에서 DeepSeek 0731: 68 tok/s로 오버클럭, 카드 작성자가 57을 얻은 이유

DeepSeekDeepSeek NVIDIANVIDIA vLLMvLLM
한 개발자가 듀얼 NVIDIA DGX Spark 설정에서 DeepSeek-V4-Flash를 벤치마킹하여 처음에는 모델 카드에 명시된 57 tok/s 대비 42.5 tok/s를 측정했습니다. vLLM 런타임 이미지를 전환하고 B12X MoE 백엔드를 명시적으로 활성화한 후, 카드 유사 프로필에서 67.6 tok/s를 달성했으며, 이는 특정 구성 변경 덕분이라고 설명했습니다.
저자는 QSFP 200G와 RoCEv2로 연결된 두 대의 DGX Spark 노드에 DeepSeek-V4-Flash를 배포하고, 노드 간 텐서 병렬 처리를 사용했습니다. 초기 측정 결과 42.5 tok/s로, 모델 카드에 명시된 57 tok/s보다 약 25% 낮았습니다. 여러 가설(온도, 프리필 계산, 컨텍스트 길이)을 테스트한 후, 주요 차이는 런타임 이미지 때문인 것으로 밝혀졌습니다. vLLM 0.21.1 기반 빌드에서 vLLM 0.25.2 기반 빌드로 전환했을 때 동일한 체크포인트에서 +22%의 성능 향상을 보였으며, 검증 단계당 출력 토큰 수가 3.27에서 4.80으로 증가했습니다. 추가적인 성능 향상은 --moe-backend flashinfer_b12x를 명시적으로 설정함으로써 얻을 수 있었는데, 이는 사용자 정의 이미지에서 B12X가 자동 선택에서 제외되기 때문입니다. 이 설정으로 카드 유사 프로필에서 평균 +13.3%의 성능 향상(59.7에서 67.6 tok/s)을 얻었습니다. 저자는 또한 에이전트 벤치마크가 개선된 새로운 체크포인트 릴리스(0731)에 대해 언급하고, 유사한 최적화 작업을 수행한 tonyd2wild의 병행 작업을 인정했습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스