⚡ BREAKING
Sumber TerbukaPerangkat Keras & Inferensi 🇺🇸 24.07.2026 01:03

Gigatoken: Tokenizer BPE dalam Rust Mengenkode Teks pada 24,53 GB/detik, Hingga 989x Lebih Cepat dari HuggingFace Tokenizers

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA MicrosoftMicrosoft Allen Institute for AIAllen Institute for AI Answer.AIAnswer.AI MistralMistral
Gigatoken, tokenizer BPE yang ditulis dalam Rust oleh mahasiswa PhD Stanford Marcel Rød, mencapai kecepatan enkode teks 24,53 GB/detik pada sistem AMD EPYC 144-inti, mengungguli HuggingFace tokenizers hingga 989x dan tiktoken milik OpenAI hingga 681x. Pustaka ini mendukung 23 keluarga tokenizer dan mengaitkan kecepatannya dengan pretokenizer yang dioptimalkan secara manual menggunakan teknik SIMD SWAR serta caching pretoken.
Doktor PhD Stanford, Marcel Rød, merilis Gigatoken, sebuah tokenizer byte-pair encoding (BPE) yang ditulis dalam Rust dengan pengikatan Python, di bawah lisensi MIT. Pada sistem dual-socket AMD EPYC 9565 dengan 144 inti, Gigatoken memproses korpus owt_train.txt sebesar 11,9 GB pada kecepatan 24,53 GB/s, dibandingkan dengan HuggingFace tokenizers pada 24,8 MB/s (989x lebih lambat) dan tiktoken milik OpenAI pada 36,0 MB/s (681x lebih lambat). Pada Apple M4 Max dengan 16 inti, ia mencapai 8,79 GB/s, mengungguli HuggingFace sebesar 1.268x dan tiktoken sebesar 140x. Peningkatan kinerja ini berasal dari pretokenizer yang ditulis tangan menggunakan teknik SWAR (SIMD Within A Register) untuk memeriksa 8 byte sekaligus dengan aritmetika tanpa cabang, mencapai 1.049 MiB/s untuk pretokenisasi GPT-2 — peningkatan 22,3x dibandingkan pendekatan berbasis regex. Selain itu, caching pretoken menghindari komputasi ulang kata-kata yang telah terlihat sebelumnya. Mode kompatibilitas dengan tokenizer HuggingFace atau tiktoken yang sudah ada mencapai percepatan 200–300x karena overhead Python. Tolok ukur independen di KrabArena dengan VM 4 vCPU mengonfirmasi throughput median sebesar 277,8 MB/s, mengungguli tiktoken sebesar 26,2x dan tokenizers sebesar 83,4x. Pustaka ini mendukung 23 keluarga tokenizer termasuk GPT-2, Llama 3–4, Qwen 2–3.6, DeepSeek V3/R1/V4, GLM 4/5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma, dan Mistral, tetapi tokenizer SentencePiece hanya mengalami percepatan 7–22x dan WordPiece tidak didukung.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru