Donanım ve Çıkarım 🇷🇺 04.08.2026 11:03

Eski Dizüstü Bilgisayar Kümesinde Büyük Dil Modeli Çıkarımı

MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Bir deney, llama.cpp'nin Uzak Prosedür Çağrısı (RPC) protokolünü kullanarak üç eski dizüstü bilgisayar üzerinde dağıtık büyük dil modeli (LLM) çıkarımını test etti. Sonuçlar, dağıtık çıkarımın yalnızca model tek bir düğümün belleğine sığmadığında belirgin bir hız artışı sağladığını; daha küçük modellerde ise ağ yükünün tek bir hızlı düğümü daha hızlı hale getirdiğini gösteriyor. Test ayrıca, istem işlemenin paralellikten fayda sağladığını, ancak token üretiminin fayda sağlamadığını ortaya çıkardı.
Üç eski dizüstü bilgisayardan oluşan bir küme üzerinde dağıtık LLM çıkarımını test etmek için bir deney yapıldı. Bilgisayarlar farklı nesillerden Intel CPU'lara sahipti: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) ve Core i3-1115G4 (Tiger Lake, 2020), toplam 52 GB RAM. Kullanılan yazılım llama.cpp (yapı b10069) idi ve her düğümde bir RPC sunucusu vardı; düğümler gigabit Ethernet ile bağlandı. Test edilen modeller Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (tümü Q4_K_M) ve gpt-oss-20b (MoE) idi. 1B modeli için küme (i3+i5) 22.5 t/s token üretimi verirken, en iyi tek düğüm (i3) 29.2 t/s verdi, bu da %23'lük bir yavaşlama demek. 8B modeli için küme, tek başına neredeyse eşit performans gösterdi (4.6'ya karşı 4.9 t/s), ancak prompt işleme neredeyse 3 kat daha hızlıydı (10.9'a karşı 3.9 t/s). 32B modeli için, hiçbir tek düğüme sığmayan model, küme 1.1 t/s elde etti; takas (swap) kullanan bir düğümde ise 0.3 t/s, yani %268 iyileşme. Tek bir düğüme sığmayan MoE modeli gpt-oss-20b ile küme, kararsız tek başına performansa kıyasla 8.0-8.1 t/s üretim ve 15.4-15.9 t/s prompt değerlendirmesi verdi. Sonuç olarak, dağıtık çıkarım yalnızca model tek bir düğüme sığmadığında mantıklıdır; aksi takdirde tek bir hızlı düğüm daha iyidir. Ayrıca, prompt işleme paralellikten faydalanırken, token üretimi faydalanmaz ve herhangi bir zayıf düğüm kümeyi darboğaz yapabilir.
Kaynak: Habr — хаб ML — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler