Inferencia de LLM en un clúster de portátiles antiguos
Meta
Alibaba/Qwen
OpenAI
Un experimento probó la inferencia distribuida de LLM en tres portátiles antiguos utilizando el protocolo RPC de llama.cpp. Los resultados muestran que la inferencia distribuida solo proporciona una aceleración significativa cuando el modelo no cabe en la memoria de un solo nodo; para modelos más pequeños, la sobrecarga de red hace que un solo nodo rápido sea más rápido. La prueba también reveló que el procesamiento de prompts se beneficia del paralelismo, mientras que la generación de tokens no.
Se realizó un experimento para probar la inferencia distribuida de LLM en un clúster de tres portátiles antiguos con CPUs Intel de diferentes generaciones: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) y Core i3-1115G4 (Tiger Lake, 2020), con un total de 52 GB de RAM. El software utilizado fue llama.cpp (compilación b10069) con un servidor RPC en cada nodo, y los nodos se conectaron mediante Ethernet de gigabit. Los modelos probados fueron Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (todos en Q4_K_M) y gpt-oss-20b (MoE). Para el modelo de 1B, el clúster (i3+i5) dio 22.5 t/s de generación de tokens frente a 29.2 t/s en el mejor nodo individual (i3), una ralentización del 23%. Para el modelo de 8B, el clúster estuvo casi a la par con el nodo individual (4.6 frente a 4.9 t/s), pero el procesamiento de prompt fue casi 3 veces más rápido (10.9 frente a 3.9 t/s). Para el modelo de 32B, que no cabía en ningún nodo individual, el clúster logró 1.1 t/s frente a 0.3 t/s en un nodo con swapping, una mejora del 268%. Con el modelo MoE gpt-oss-20b, que tampoco cabía en un solo nodo, el clúster dio una generación estable de 8.0-8.1 t/s y una evaluación de prompt de 15.4-15.9 t/s, en comparación con el rendimiento inestable del nodo individual. La conclusión es que la inferencia distribuida solo se justifica cuando el modelo no cabe en un solo nodo; de lo contrario, un solo nodo rápido es mejor. Además, el procesamiento de prompt se beneficia del paralelismo, mientras que la generación de tokens no, y cualquier nodo débil puede convertirse en un cuello de botella para el clúster.
Fuente: Habr — хаб ML —
original
