Hardware e Inferência 🇷🇺 04.08.2026 11:03

Inferência de LLM em um Cluster de Laptops Antigos

MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Um experimento testou a inferência distribuída de LLM em três laptops antigos usando o protocolo RPC do llama.cpp. Os resultados mostram que a inferência distribuída só proporciona um ganho significativo de velocidade quando o modelo não cabe na memória de um único nó; para modelos menores, a sobrecarga de rede torna um único nó rápido mais veloz. O teste também revelou que o processamento de prompts se beneficia do paralelismo, enquanto a geração de tokens não.
Foi conduzido um experimento para testar a inferência distribuída de LLMs em um cluster de três laptops antigos com CPUs Intel de diferentes gerações: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) e Core i3-1115G4 (Tiger Lake, 2020), totalizando 52 GB de RAM. O software utilizado foi o llama.cpp (build b10069) com um servidor RPC em cada nó, e os nós foram conectados via Ethernet gigabit. Os modelos testados foram Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (todos Q4_K_M) e gpt-oss-20b (MoE). Para o modelo de 1B, o cluster (i3+i5) gerou 22,5 t/s de geração de tokens versus 29,2 t/s no melhor nó isolado (i3), uma desaceleração de 23%. Para o modelo de 8B, o cluster ficou quase em paridade com o nó isolado (4,6 vs 4,9 t/s), mas o processamento do prompt foi quase 3 vezes mais rápido (10,9 vs 3,9 t/s). Para o modelo de 32B, que não cabia em nenhum nó individual, o cluster alcançou 1,1 t/s versus 0,3 t/s em um nó com swapping, uma melhoria de 268%. Com o modelo MoE gpt-oss-20b, que também não cabia em um único nó, o cluster apresentou geração estável de 8,0-8,1 t/s e avaliação de prompt de 15,4-15,9 t/s, em comparação com desempenho instável no nó isolado. A conclusão é que a inferência distribuída só se justifica quando o modelo não cabe em um único nó; caso contrário, um único nó rápido é melhor. Além disso, o processamento de prompts se beneficia do paralelismo, enquanto a geração de tokens não, e qualquer nó fraco pode se tornar um gargalo para o cluster.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas