⚡ BREAKING
Open SourceHardware & Inferentie 🇺🇸 24.07.2026 01:03

Gigatoken: BPE Tokenizer in Rust versnelt tekstencodering tot 24,53 GB/s, tot 989x sneller dan HuggingFace Tokenizers

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA MicrosoftMicrosoft Allen Institute for AIAllen Institute for AI Answer.AIAnswer.AI MistralMistral
Gigatoken, een BPE-tokenizer geschreven in Rust door Stanford-promovendus Marcel Rød, bereikt tekstencoderingssnelheden van 24,53 GB/s op een 144-core AMD EPYC-systeem. Dit is 989x sneller dan HuggingFace-tokenizers en 681x sneller dan OpenAI's tiktoken. De bibliotheek ondersteunt 23 tokenizerfamilies en dankt zijn snelheid aan een handgeoptimaliseerde pretokenizer die gebruikmaakt van SWAR SIMD-technieken en pretoken-caching.
Promovendus Marcel Rød van Stanford heeft Gigatoken uitgebracht, een byte-pair encoding (BPE)-tokenizer geschreven in Rust met Python-bindingen, onder een MIT-licentie. Op een systeem met twee AMD EPYC 9565-processors met in totaal 144 kernen verwerkte Gigatoken de 11,9 GB grote owt_train.txt-corpus met een snelheid van 24,53 GB/s, vergeleken met HuggingFace tokenizers op 24,8 MB/s (989 keer langzamer) en OpenAI's tiktoken op 36,0 MB/s (681 keer langzamer). Op een Apple M4 Max met 16 kernen behaalde het 8,79 GB/s, waarmee het HuggingFace met 1.268 keer en tiktoken met 140 keer overtrof. De prestatiewinst komt van een handgeschreven pretokenizer die SWAR (SIMD Within A Register)-technieken gebruikt om 8 bytes tegelijk te controleren met vertakkingsvrije rekenkunde, waarmee 1.049 MiB/s wordt bereikt voor GPT-2-pretokenization — een verbetering van 22,3 keer ten opzichte van op reguliere expressies gebaseerde benaderingen. Daarnaast voorkomt pretoken-caching herberekening van eerder geziene woorden. Compatibiliteitsmodus met bestaande HuggingFace- of tiktoken-tokenizers levert een versnellingsfactor van 200 tot 300 keer op door Python-overhead. Onafhankelijke benchmarks op KrabArena met een virtuele machine met 4 vCPU's bevestigden een mediane doorvoersnelheid van 277,8 MB/s, waarmee tiktoken met 26,2 keer en tokenizers met 83,4 keer werd overtroffen. De bibliotheek ondersteunt 23 tokenizerfamilies, waaronder GPT-2, Llama 3–4, Qwen 2–3.6, DeepSeek V3/R1/V4, GLM 4/5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma en Mistral, maar SentencePiece-tokenizers zien slechts een versnellingsfactor van 7 tot 22 keer en WordPiece wordt niet ondersteund.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws