LLM-päätelmä: KV-välimuistista tuotantokäyttöön
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
MLOps-insinööri hh.ru:lta selittää LLM-päätelmän perusteet paikallisella laitteistolla. Artikkeli kattaa KV-välimuistin, päätelmämoottorit vLLM ja SGLang, huomiomekanismien kehityksen (MHA, GQA, MLA, DSA) sekä käytännön suosituksia laitteiston ja rinnakkaisuusskeemojen valintaan.
MLOps-insinööri Alexander Ryzhovin hh.ru:ssa julkaisema artikkeli käsittelee suurten kielimallien (LLM) käyttöönoton haasteita ja ratkaisuja omilla palvelimilla. Keskeinen oivallus on, että päättelyn tehokkuutta hallitsee grafiikkamuistin hallinta. KV-välimuisti siirtää dekoodausvaiheen laskentasidonnaisesta muistikaistasidonnaiseksi. Kirjoittaja selittää huomiointimekanismien kehitystä: MHA (2017), GQA (2023), DeepSeekin MLA (2024) ja DSA (2025) DeepSeek v3.2:ssa, joista jokainen pienentää KV-välimuistin kokoa. Päättelymoottoreista avoimen lähdekoodin vLLM käyttää PagedAttentionia vähentämään muistin pirstoutumista, kun taas avoimen lähdekoodin SGLang käyttää RadixAttentionia joustavampaan etuliitevälimuistitukseen. Laitteiston osalta SGLangia suositellaan H100:lle ja uudemmille, vLLM:ää Ampereille ja vanhemmille. Yhdelle solmulle (8x H100, 640 Gt VRAM) sopivia malleja ovat MoE-mallit enintään noin 120B ja tiheät mallit enintään noin 32B. Tensoririnnakkaisuus (TP) vähentää viivettä, tietorinnakkaisuus (DP) maksimoi suorituskyvyn. Esitäyttö/dekoodaus-eriyttäminen antaa korkeimman suorituskyvyn, mutta vaatii enemmän suunnittelutyötä. Spekulatiivinen dekoodaus ei ole ihmelääke, sillä se heikentää suurta samanaikaisuutta kuormitettaessa. Artikkeli päättyy tarkistuslistaan tuotantokäyttöönottoa varten.
Lähde: Habr — хаб ИИ —
Alkuperäinen
