⚡ ÚLTIMA HORA
Código AbiertoHardware e Inferencia 🇺🇸 24.07.2026 01:03

Gigatoken: tokenizador BPE en Rust codifica texto a 24,53 GB/s, hasta 989 veces más rápido que los tokenizadores de HuggingFace

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA MicrosoftMicrosoft Allen Institute for AIAllen Institute for AI Answer.AIAnswer.AI MistralMistral
Gigatoken, un tokenizador BPE escrito en Rust por el estudiante de doctorado de Stanford Marcel Rød, alcanza velocidades de codificación de texto de 24,53 GB/s en un sistema AMD EPYC de 144 núcleos, superando a los tokenizadores de HuggingFace en 989 veces y al tiktoken de OpenAI en 681 veces. La biblioteca admite 23 familias de tokenizadores y atribuye su velocidad a un pretokenizador optimizado manualmente mediante técnicas SIMD SWAR y almacenamiento en caché de pretokens.
El estudiante de doctorado de Stanford, Marcel Rød, lanzó Gigatoken, un tokenizador de codificación por pares de bytes (BPE, por sus siglas en inglés) escrito en Rust con enlaces para Python, bajo una licencia MIT. En un sistema de doble socket con AMD EPYC 9565 de 144 núcleos, Gigatoken procesó el corpus owt_train.txt de 11,9 GB a 24,53 GB/s, en comparación con HuggingFace tokenizers a 24,8 MB/s (989 veces más lento) y tiktoken de OpenAI a 36,0 MB/s (681 veces más lento). En un Apple M4 Max con 16 núcleos, alcanzó 8,79 GB/s, superando a HuggingFace en 1.268 veces y a tiktoken en 140 veces. Las ganancias de rendimiento provienen de un pretokenizador escrito a mano que utiliza técnicas SWAR (SIMD Within A Register, SIMD dentro de un registro) para verificar 8 bytes a la vez con aritmética sin bifurcaciones, logrando 1.049 MiB/s para la pretokenización de GPT-2, una mejora de 22,3 veces sobre los enfoques basados en expresiones regulares. Además, el almacenamiento en caché de pretokenización evita el recálculo de palabras ya vistas. El modo de compatibilidad con tokenizadores existentes de HuggingFace o tiktoken logra una aceleración de 200 a 300 veces debido a la sobrecarga de Python. Pruebas independientes en KrabArena con una máquina virtual de 4 vCPU confirmaron un rendimiento medio de 277,8 MB/s, superando a tiktoken en 26,2 veces y a tokenizers en 83,4 veces. La biblioteca admite 23 familias de tokenizadores, incluyendo GPT-2, Llama 3–4, Qwen 2–3.6, DeepSeek V3/R1/V4, GLM 4/5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma y Mistral, pero los tokenizadores SentencePiece solo ven una aceleración de 7 a 22 veces y WordPiece no es compatible.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas