Yksi RTX 5090, hinnat 1 ruplasta 20 726 ruplaan miljoonaa tokenia kohden, ja miksi API on edelleen halvempi

NVIDIANVIDIA
ML-tietohallintojohtaja purkaa oman RTX 5090 -näytönohjaimen käytön todelliset kustannukset tekoälyn päättelyssä, osoittaen että hinta miljoonaa tokenia kohden vaihtelee 1 ruplasta yli 20 000 ruplaan riippuen mallin koosta, kvantisoinnista ja samanaikaisesta kuormituksesta. Artikkeli väittää, että näistä luvuista huolimatta API-palvelut ovat usein edelleen halvempia useimmille tiimeille, koska kannattavuusraja on korkea.
Kirjoittaja, ML CTO, käsittelee jatkuvaa keskustelua siitä, kannattaako ostaa GPU itse isännöityä päättelyä varten vai maksaa pilvirajapinnoista. Hän laskee RTX 5090 (32 Gt) -näytönohjaimen käyttökustannukset Venäjällä, mukaan lukien poistot, sähkö ja järjestelmäkustannukset. Tulokseksi saadaan noin 17 ruplaa tunnissa eli 12 435 ruplaa kuukaudessa, kun laite toimii ympäri vuorokauden. Artikkelissa osoitetaan, että hinta miljoonaa tokenia kohden samalla näytönohjaimella vaihtelee villisti yhdestä ruplasta 20 726 ruplaan riippuen mallista ja työmäärästä. Hän vertailee eri näytönohjaimia hinnan per VRAM-gigatavu ja huomauttaa, että RTX 3090 on huomattavasti halvempi gigatavua kohden. Lisäksi käsitellään monen GPU:n kokoonpanoja, jotka ovat usein tehottomia PCIe-pullonkaulojen vuoksi. Keskeiset suorituskykymittaukset llama.cpp:ssä osoittavat tokenien tuotantonopeuksien vaihtelevan 61:stä 234:ään tokeniin sekunnissa eri malleilla, kun taas vLLM jatkuvalla eräkäsittelyllä yhdellä 5090:llä voi saavuttaa noin 4 570 tokenia sekunnissa yhteensä satojen samanaikaisten pyyntöjen käsittelyssä. Tästä huolimatta kannattavuusraja seitsemää API-palvelua vastaan on korkea, usein yli realistisen kuukausittaisen token-kulutuksen, minkä vuoksi kirjoittaja päättelee, että API:t ovat yleensä kustannustehokkaampia useimmille tiimeille.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset