Inferentie van LLM op een Cluster van Oude Laptops
Meta
Alibaba/Qwen
OpenAI
Een experiment testte gedistribueerde LLM-inferentie over drie oude laptops met behulp van het RPC-protocol van llama.cpp. De resultaten tonen aan dat gedistribueerde inferentie alleen significante versnelling biedt wanneer het model niet in het geheugen van één enkele node past; voor kleinere modellen maakt de netwerkoverhead een enkele snelle node sneller. De test onthulde ook dat promptverwerking profiteert van parallellisme, terwijl token generatie dat niet doet.
Er is een experiment uitgevoerd om gedistribueerde LLM-inferentie te testen op een cluster van drie oude laptops met Intel-CPU's van verschillende generaties: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) en Core i3-1115G4 (Tiger Lake, 2020), met in totaal 52 GB RAM. De gebruikte software was llama.cpp (build b10069) met een RPC-server op elk knooppunt, en de knooppunten waren verbonden via gigabit Ethernet. De geteste modellen waren Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (allemaal Q4_K_M) en gpt-oss-20b (MoE). Voor het 1B-model gaf het cluster (i3+i5) 22,5 t/s tokengeneratie versus 29,2 t/s op het snelste solo-knooppunt (i3), een vertraging van 23%. Voor het 8B-model was het cluster bijna op gelijke hoogte met solo (4,6 vs. 4,9 t/s), maar de promptverwerking was bijna 3 keer sneller (10,9 vs. 3,9 t/s). Voor het 32B-model, dat niet in één enkel knooppunt paste, behaalde het cluster 1,1 t/s versus 0,3 t/s op een knooppunt met swapping, een verbetering van 268%. Met het MoE-model gpt-oss-20b, dat ook niet op één knooppunt paste, gaf het cluster stabiele 8,0-8,1 t/s generatie en 15,4-15,9 t/s prompt-evaluatie, vergeleken met instabiele solo-prestaties. De conclusie is dat gedistribueerde inferentie alleen gerechtvaardigd is wanneer het model niet in één knooppunt past; anders is een enkel snel knooppunt beter. Ook profiteert promptverwerking van parallellisme, terwijl tokengeneratie dat niet doet, en kan elk zwak knooppunt het cluster als knelpunt belemmeren.
Bron: Habr — хаб ML —
origineel
