Laitteisto ja päättely 🇷🇺 04.08.2026 11:03

Suurten kielimallien päättely vanhojen kannettavien klusterissa

MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Kokeessa testattiin hajautettua suurten kielimallien päättelyä kolmen vanhan kannettavan tietokoneen yli käyttäen llama.cpp:n RPC-protokollaa. Tulokset osoittavat, että hajautettu päättely tuo merkittävän nopeushyödyn vain silloin, kun malli ei mahdu yhden solmun muistiin; pienemmillä malleilla verkon ylikuormitus tekee yksittäisestä nopeasta solmusta nopeamman. Testi paljasti myös, että kehotteen käsittely hyötyy rinnakkaisuudesta, mutta tokenien tuottaminen ei.
Kokeessa testattiin hajautettua LLM-päätelmää kolmen vanhan kannettavan tietokoneen klusterissa, joissa oli eri sukupolvien Intel-suorittimet: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) ja Core i3-1115G4 (Tiger Lake, 2020), yhteensä 52 gigatavua keskusmuistia. Käytetty ohjelmisto oli llama.cpp (build b10069) RPC-palvelimella jokaisessa solmussa, ja solmut oli yhdistetty gigabitin Ethernetillä. Testatut mallit olivat Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (kaikki Q4_K_M) ja gpt-oss-20b (MoE). Yhden miljardin parametrin mallilla klusteri (i3+i5) tuotti 22,5 tokenia sekunnissa token-generoinnissa, kun parhaan yksittäisen solmun (i3) tulos oli 29,2 tokenia sekunnissa, eli 23 prosentin hidastuminen. Kahdeksan miljardin mallilla klusteri oli lähes sama kuin yksittäinen solmu (4,6 vs. 4,9 tokenia sekunnissa), mutta promptin käsittely oli lähes kolme kertaa nopeampi (10,9 vs. 3,9 tokenia sekunnissa). Kolmenkymmenenkahden miljardin mallilla, joka ei mahtunut mihinkään yksittäiseen solmuun, klusteri saavutti 1,1 tokenia sekunnissa verrattuna 0,3 tokeniin sekunnissa swap-levyä käyttävässä solmussa, mikä on 268 prosentin parannus. MoE-mallilla gpt-oss-20b, joka ei myöskään mahtunut yhteen solmuun, klusteri tuotti vakaan 8,0–8,1 tokenia sekunnissa generoinnissa ja 15,4–15,9 tokenia sekunnissa promptin arvioinnissa, kun yksittäisen solmun suorituskyky oli epävakaa. Johtopäätös on, että hajautettu päätelmä on perusteltua vain, kun malli ei mahdu yhteen solmuun; muuten yksittäinen nopea solmu on parempi. Lisäksi promptin käsittely hyötyy rinnakkaisuudesta, mutta token-generointi ei, ja mikä tahansa heikko solmu voi muodostua klusterin pullonkaulaksi.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset