Inférence de LLM sur un Cluster de Vieux Ordinateurs Portables
Meta
Alibaba/Qwen
OpenAI
Une expérience a testé l'inférence distribuée de grands modèles de langage sur trois vieux ordinateurs portables en utilisant le protocole RPC de llama.cpp. Les résultats montrent que l'inférence distribuée n'apporte un gain de vitesse significatif que lorsque le modèle ne tient pas dans la mémoire d'un seul nœud ; pour les modèles plus petits, la surcharge réseau rend un nœud unique rapide plus performant. Le test a également révélé que le traitement des invites bénéficie du parallélisme, tandis que la génération de jetons n'en profite pas.
Une expérience a été menée pour tester l'inférence distribuée de LLM sur un cluster de trois vieux ordinateurs portables avec des CPU Intel de différentes générations : Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) et Core i3-1115G4 (Tiger Lake, 2020), totalisant 52 Go de RAM. Le logiciel utilisé était llama.cpp (build b10069) avec un serveur RPC sur chaque nœud, et les nœuds étaient connectés via Ethernet gigabit. Les modèles testés étaient Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (tous en Q4_K_M) et gpt-oss-20b (MoE). Pour le modèle 1B, le cluster (i3+i5) a donné 22,5 t/s en génération de jetons contre 29,2 t/s sur le meilleur nœud seul (i3), soit un ralentissement de 23%. Pour le modèle 8B, le cluster était presque à parité avec le nœud seul (4,6 contre 4,9 t/s), mais le traitement des prompts était presque 3 fois plus rapide (10,9 contre 3,9 t/s). Pour le modèle 32B, qui ne tenait sur aucun nœud individuel, le cluster a atteint 1,1 t/s contre 0,3 t/s sur un nœud avec du swap, soit une amélioration de 268%. Avec le modèle MoE gpt-oss-20b, qui ne tenait pas non plus sur un seul nœud, le cluster a donné une génération stable de 8,0 à 8,1 t/s et une évaluation de prompt de 15,4 à 15,9 t/s, par rapport à une performance solo instable. La conclusion est que l'inférence distribuée n'est justifiée que lorsque le modèle ne tient pas sur un seul nœud ; sinon, un nœud unique rapide est préférable. De plus, le traitement des prompts bénéficie du parallélisme, contrairement à la génération de jetons, et tout nœud faible peut créer un goulot d'étranglement dans le cluster.
Source: Habr — хаб ML —
original
