Hugging Face Transformers -taustajärjestelmä vLLM:lle saavuttaa natiivin suorituskyvyn
Hugging Face
Hugging Face Transformers -kirjaston integrointi vLLM:n mallinnuksen taustajärjestelmäksi saavuttaa nyt vähintään saman tai paremman suorituskyvyn kuin natiivi vLLM eri Qwen3-malleilla, mukaan lukien tiheät ja asiantuntijasekoitusarkkitehtuurit, ilman että tarvitaan mukautettuja siirtoja. Tämä saavutetaan dynaamisilla kerrosfuusioilla suorituksen aikana käyttäen torch.fx- ja AST-käsittelyä, jolloin mikä tahansa yhteensopiva malli voidaan ajaa natiivilla nopeudella yhdellä lipulla.
Hugging Face Transformers -kirjasto, joka tukee yli 450 arkkitehtuuria, on integroitu mallinnuksen taustajärjestelmäksi vLLM:ään viime vuonna, mikä mahdollistaa mallien tekijöille Transformers-mallien suorittamisen vLLM:n sisällä ilman siirtämistä. Tämän integraation uusin versio saavuttaa nyt natiivin vLLM-päätelmänopeuden yhteensopiville malleille. Vertailuissa, joissa Transformers-taustajärjestelmää verrattiin suoraan vLLM:n natiivitoteutuksiin kolmen Qwen3-mallin (4B-tiheä, 32B-tiheä ja 235B FP8 MoE) avulla, Transformers-taustajärjestelmä saavuttaa tai ylittää natiivin suorituskyvyn kaikissa tapauksissa. Suorituskyvyn parannus syntyy soveltamalla dynaamisesti päätelmäkohtaisia kerrosfuusioita suorituksen aikana käyttämällä torch.fx:ää staattiseen analyysiin ja AST:tä lähdekoodin käsittelyyn. Nämä fuusiot sisältävät operaatioita, jotka on kartoitettu vLLM:n optimoituihin ytimiin MoE-mallien asiantuntijarinnakkaistamista varten, sekä rinnakkaisia lineaarisia kerroksia tensori- ja putkistorinnakkaistamista varten. Käsitellyt mallit pysyvät täysin käännettävinä torch.compile- ja CUDA Graphs -työkaluilla. Mitä tahansa Hugging Face -mallia voidaan ajaa yhdellä lipulla --model-impl transformers, ja se toimii yhdessä olemassa olevien rinnakkaisuusvaihtoehtojen kanssa. Malleja lineaarisella huomiolla ei vielä tueta, ja Hub-varastojen mukautetut mallit eivät todennäköisesti toimi.
Lähde: Hugging Face blog —
Alkuperäinen
