⚡ BREAKING
Avoin lähdekoodiLaitteisto ja päättely 🇺🇸 24.07.2026 01:03

Gigatoken: Rustilla toteutettu BPE-tokenisoi tekstiä 24,53 Gt/s, jopa 989 kertaa nopeammin kuin HuggingFace-tokenisaattorit

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA MicrosoftMicrosoft Allen Institute for AIAllen Institute for AI Answer.AIAnswer.AI MistralMistral
Gigatoken, Stanfordin tohtoriopiskelija Marcel Rødin Rust-kielellä kirjoittama BPE-tokenisaattori, saavuttaa tekstin koodausnopeuden 24,53 Gt/s 144-ytimisellä AMD EPYC -järjestelmällä, ylittäen HuggingFace-tokenisaattorit 989 kertaa ja OpenAI:n tiktokenin 681 kertaa. Kirjasto tukee 23 tokenisaattoriperhettä ja perustelee nopeutensa käsin optimoidulla esitokenisaattorilla, joka hyödyntää SWAR SIMD -tekniikoita ja esitokenien välimuistia.
Stanfordin tohtorikoulutettava Marcel Rød julkaisi Gigatoken-nimisen tokenisoijan, joka käyttää tavuparikoodausta (BPE) ja on kirjoitettu Rustilla Python-sidoksilla. Se on lisensoitu MIT-lisenssillä. 144-ytimisellä AMD EPYC 9565 -kaksoisprosessorijärjestelmällä Gigatoken käsitteli 11,9 gigatavun owt_train.txt-korpuksen nopeudella 24,53 gigatavua sekunnissa, kun HuggingFace-tokenisoijat ylsivät 24,8 megatavuun sekunnissa (989 kertaa hitaammin) ja OpenAI:n tiktoken 36,0 megatavuun sekunnissa (681 kertaa hitaammin). Apple M4 Max -järjestelmällä, jossa on 16 ydintä, se saavutti 8,79 gigatavua sekunnissa, mikä on 1 268 kertaa nopeampi kuin HuggingFace ja 140 kertaa nopeampi kuin tiktoken. Suorituskykyhyödyt tulevat käsin kirjoitetusta esitokenisoijasta, joka käyttää SWAR-tekniikoita (SIMD Within A Register) tarkistaakseen 8 tavua kerralla haarattomalla aritmetiikalla, saavuttaen 1 049 megatavua sekunnissa GPT-2:n esitokenisoinnissa – 22,3-kertainen parannus regex-pohjaisiin menetelmiin verrattuna. Lisäksi esitokenien välimuistiin tallentaminen välttää aiemmin nähtyjen sanojen uudelleenlaskennan. Yhteensopivuustila olemassa olevien HuggingFace- tai tiktoken-tokenisoijien kanssa saavuttaa 200–300-kertaisen nopeutuksen Pythonin ylikuormituksen ansiosta. Riippumattomat vertailut KrabArenassa 4-vCPU-virtuaalikoneella vahvistivat mediaaniläpäisynopeudeksi 277,8 megatavua sekunnissa, mikä on 26,2 kertaa nopeampi kuin tiktoken ja 83,4 kertaa nopeampi kuin tokenizers. Kirjasto tukee 23 tokenisoijaperhettä, mukaan lukien GPT-2, Llama 3–4, Qwen 2–3.6, DeepSeek V3/R1/V4, GLM 4/5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma ja Mistral, mutta SentencePiece-tokenisoijat saavat vain 7–22-kertaisen nopeutuksen, eikä WordPiece ole tuettu.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset