⚡ SON DAKİKA
Açık KaynakDonanım ve Çıkarım 🇺🇸 24.07.2026 01:03

Gigatoken: Rust ile Yazılmış BPE Tokenizer Metni Saniyede 24,53 GB Hızında Kodluyor, HuggingFace Tokenizer'lardan 989 Kata Kadar Daha Hızlı

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA MicrosoftMicrosoft Allen Institute for AIAllen Institute for AI Answer.AIAnswer.AI MistralMistral
Gigatoken, Stanford doktora öğrencisi Marcel Rød tarafından Rust dilinde yazılmış bir BPE tokenizer olup, 144 çekirdekli bir AMD EPYC sisteminde saniyede 24,53 GB metin kodlama hızına ulaşarak HuggingFace tokenizer'larından 989 kat, OpenAI'ın tiktoken'ından ise 681 kat daha hızlı performans göstermektedir. Kütüphane 23 tokenizer ailesini desteklemekte olup, hızını SWAR SIMD teknikleri ve ön bellek kullanımı ile el ile optimize edilmiş bir pretokenizer'a borçludur.
Stanford doktora öğrencisi Marcel Rød, MIT lisansı altında Python bağlamaları ile Rust dilinde yazılmış bir ikili kodlama (Byte-Pair Encoding, BPE) tokenleştiricisi olan Gigatoken'ı yayınladı. 144 çekirdekli AMD EPYC 9565 çift soketli bir sistemde Gigatoken, 11.9 GB'lık owt_train.txt derlemesini 24.53 GB/s hızında işlerken, HuggingFace tokenleştiricileri 24.8 MB/s (989 kat daha yavaş) ve OpenAI'nin tiktoken'i 36.0 MB/s (681 kat daha yavaş) hızındaydı. 16 çekirdekli Apple M4 Max'te ise 8.79 GB/s hıza ulaşarak HuggingFace'i 1.268 kat, tiktoken'i ise 140 kat geride bıraktı. Performans artışı, SWAR (Register İçinde SIMD) tekniklerini kullanarak 8 baytı aynı anda ve dalsız aritmetikle kontrol eden elle yazılmış bir ön tokenleştiriciden geliyor; bu, GPT-2 ön tokenleştirmesinde 1.049 MiB/s hızına ulaşarak düzenli ifade tabanlı yöntemlere göre 22.3 kat iyileştirme sağlıyor. Ayrıca, önceden görülen kelimelerin yeniden hesaplanmasını önleyen ön token önbellekleme kullanılıyor. Mevcut HuggingFace veya tiktoken tokenleştiricileriyle uyumluluk modu, Python yükü nedeniyle 200–300 kat hızlanma sağlıyor. 4 vCPU'lu bir sanal makine ile KrabArena'da yapılan bağımsız kıyaslamalar, ortanca işleme hızını 277.8 MB/s olarak doğruladı; bu, tiktoken'i 26.2 kat, tokenizers'ı 83.4 kat geride bırakıyor. Kütüphane, GPT-2, Llama 3–4, Qwen 2–3.6, DeepSeek V3/R1/V4, GLM 4/5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma ve Mistral dahil 23 tokenleştirici ailesini desteklerken, SentencePiece tokenleştiriciler yalnızca 7–22 kat hızlanma görmekte ve WordPiece desteklenmemektedir.
Kaynak: MarkTechPost — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler