⚡ 突发新闻
开源硬件与推理 🇺🇸 24.07.2026 01:03

Gigatoken:用Rust实现的BPE分词器,编码速度达24.53 GB/s,比HuggingFace分词器快989倍

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA MicrosoftMicrosoft Allen Institute for AIAllen Institute for AI Answer.AIAnswer.AI MistralMistral
Gigatoken是一个由斯坦福博士生Marcel Rød用Rust编写的BPE分词器,在144核AMD EPYC系统上实现了24.53 GB/s的文本编码速度,比HuggingFace分词器快989倍,比OpenAI的tiktoken快681倍。该库支持23种分词器家族,其速度归功于使用SWAR SIMD技术和分词缓存的手工优化预分词器。
斯坦福大学博士生 Marcel Rød 发布了 Gigatoken,这是一个用 Rust 编写、带有 Python 绑定的字节对编码(BPE)分词器,采用 MIT 许可证。在双路 144 核 AMD EPYC 9565 系统上,Gigatoken 以 24.53 GB/s 的速度处理了 11.9 GB 的 owt_train.txt 语料库,而 HuggingFace tokenizers 为 24.8 MB/s(慢 989 倍),OpenAI 的 tiktoken 为 36.0 MB/s(慢 681 倍)。在配备 16 核的 Apple M4 Max 上,它达到了 8.79 GB/s,比 HuggingFace 快 1268 倍,比 tiktoken 快 140 倍。性能提升得益于手写的预分词器,该预分词器使用 SWAR(寄存器内单指令多数据)技术,通过无分支算术一次性检查 8 个字节,GPT-2 预分词速度达到 1049 MiB/s,相比基于正则表达式的方法提升了 22.3 倍。此外,预分词缓存避免了重复计算已见过的单词。与现有 HuggingFace 或 tiktoken 分词器的兼容模式由于 Python 开销实现了 200–300 倍的加速。在 KrabArena 上使用 4 vCPU 虚拟机的独立基准测试确认了 277.8 MB/s 的中位数吞吐量,比 tiktoken 快 26.2 倍,比 tokenizers 快 83.4 倍。该库支持 23 个分词器系列,包括 GPT-2、Llama 3–4、Qwen 2–3.6、DeepSeek V3/R1/V4、GLM 4/5、Kimi K2、Nemotron 3、Phi-4、OLMo 2/3、ModernBERT、Gemma 和 Mistral,但 SentencePiece 分词器仅获得 7–22 倍加速,且不支持 WordPiece。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻