Inferenssin nopeuttaminen encoder-suojamallissa: TensorRT, Triton, vLLM, Ray Serve
NVIDIA
vLLM
Ray
Artikkelissa verrataan työkaluja zero-shot-tyyppisen PII-encoder-suojamallin nopeuttamiseen, joka tarkistaa LLM-sovelluksen syötteen ja lähdön. Kirjoittaja testaa TensorRT:tä, NVIDIA Tritonia, vLLM:ää, Ray Serveä ja Flash DeBERTa -selkärankaa ja mittaa RPS:ää ja viivettä. TensorRT FP16 antaa 23 prosentin parannuksen PyTorch FP16:een verrattuna, mutta INT8-kvantisointi epäonnistuu mukautettujen operaatioiden vuoksi.
Artikkelissa kuvataan yritys nopeuttaa suojamallia, joka sijaitsee suuren kielimallin ja käyttäjän välissä ja tarkistaa vaarallisen sisällön. Malli on nollajaksoinen henkilötietojen tunnistin: se ottaa entiteettityypit tekstisyötteenä sekä asiakirjan, poimii entiteetit ja luokittelee turvallisuuden yhdessä eteenpäin suuntautuvassa ajossa. Arkkitehtuurinsa vuoksi se asettaa seitsemän teknistä rajoitetta: muuttuvan muotoinen syöte, ei-tensorimuotoinen tuloste, joka vaatii suorittimen span-purun, tietyt operaatiot kuten gather ja bilineaarinen pisteytys, mahdollisesti epästandardi tarkkailumekanismi, erän kustannus määräytyy pisimmän elementin mukaan, palveluinfrastruktuuri, joka on optimoitu autoregressiivisille kielimalleille, sekä häntäviiveen (P95, P99) tärkeys, koska suojaa kutsutaan kahdesti jokaista vuoropuhelun kierrosta kohti. Kokeessa verrataan viittä työkalua: TensorRT-runtimea, NVIDIA Tritonia, vLLM:ää, Ray Servea ja Flash DeBERTa -selkärankaa, perustasona LitServe. TensorRT:n runtime-ajossa käytettiin lyhyttä kuormitusprofiilia (yksi työntekijä, 50 käyttäjää, 60 sekuntia), kun taas palveluajoissa käytettiin pidempää profiilia (neljä työntekijää, 100 käyttäjää, 15 minuuttia), joten lukuja voidaan verrata vain saman kategorian sisällä. TensorRT FP16 -versio saavuttaa 130,72 pyyntöä sekunnissa verrattuna PyTorch FP16:n 106,49 pyyntöön sekunnissa, mikä on 23 prosentin parannus. INT8-kvantisointiyritykset epäonnistuivat mukautettujen operaatioiden tuen puutteen vuoksi, mikä johti erittäin alhaiseen pyyntötahtiin ja korkeaan viiveeseen.
Lähde: Habr — хаб ML —
Alkuperäinen
