오래된 노트북 클러스터에서 LLM 추론하기
Meta
Alibaba/Qwen
OpenAI
한 실험에서 llama.cpp의 RPC(Remote Procedure Call) 프로토콜을 사용하여 세 대의 오래된 노트북에 걸쳐 분산 LLM 추론을 테스트했습니다. 결과에 따르면 분산 추론은 모델이 단일 노드의 메모리에 맞지 않을 때만 상당한 속도 향상을 제공하며, 더 작은 모델의 경우 네트워크 오버헤드 때문에 단일 고속 노드가 더 빠른 것으로 나타났습니다. 또한 테스트 결과 프롬프트 처리는 병렬 처리의 이점을 얻지만, 토큰 생성은 그렇지 않다는 사실도 드러났습니다.
분산 LLM 추론을 테스트하기 위해 서로 다른 세대의 Intel CPU를 탑재한 오래된 노트북 세 대로 클러스터를 구성하여 실험을 진행했습니다: Core i7-4700MQ(하스웰, 2013), Core i5-8265U(위스키 레이크, 2018), Core i3-1115G4(타이거 레이크, 2020)로, 총 RAM은 52GB입니다. 사용된 소프트웨어는 llama.cpp(빌드 b10069)로 각 노드에 RPC 서버를 두고, 노드들은 기가비트 이더넷으로 연결했습니다. 테스트된 모델은 Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct(모두 Q4_K_M), 그리고 gpt-oss-20b(MoE)입니다. 1B 모델의 경우, 클러스터(i3+i5)는 토큰 생성 속도가 22.5 t/s로, 가장 빠른 단일 노드(i3)의 29.2 t/s보다 23% 느렸습니다. 8B 모델의 경우, 클러스터는 단일 노드와 거의 동등했지만(4.6 대 4.9 t/s), 프롬프트 처리 속도는 거의 3배 빨랐습니다(10.9 대 3.9 t/s). 32B 모델은 단일 노드에 맞지 않았으며, 클러스터는 스왑을 사용하는 노드에서의 0.3 t/s 대비 1.1 t/s로 268% 향상된 성능을 보였습니다. 단일 노드에 맞지 않는 MoE 모델 gpt-oss-20b의 경우, 클러스터는 안정적인 8.0-8.1 t/s 생성 속도와 15.4-15.9 t/s 프롬프트 평가 속도를 보였으며, 이는 불안정한 단일 노드 성능과 대조적입니다. 결론적으로, 분산 추론은 모델이 단일 노드에 맞지 않을 때만 정당화되며, 그 외에는 빠른 단일 노드가 더 낫습니다. 또한, 프롬프트 처리는 병렬화의 이점을 얻지만 토큰 생성은 그렇지 않으며, 약한 노드 하나가 클러스터의 병목이 될 수 있습니다.
출처: Habr — хаб ML —
원문
