⚡ عاجل
Gigatoken: أداة BPE للترميز بلغة Rust تشفر النص بسرعة 24.53 جيجابايت/ثانية، أسرع حتى 989 مرة من أدوات HuggingFace
OpenAI
Hugging Face
Google/DeepMind
Meta
Alibaba/Qwen
DeepSeek
Moonshot AI
NVIDIA
Microsoft
Allen Institute for AI
Answer.AI
Mistral
Gigatoken، وهي أداة ترميز BPE كتبها الطالب في جامعة ستانفورد مارسيل رود بلغة Rust، تحقق سرعة تشفير نص تبلغ 24.53 جيجابايت/ثانية على نظام AMD EPYC ذي 144 نواة، متفوقة على أدوات HuggingFace بمقدار 989 مرة وعلى tiktoken من OpenAI بمقدار 681 مرة. تدعم الأداة 23 عائلة من أدوات الترميز وتعزو سرعتها إلى أداة ما قبل الترميز المحسنة يدويًا باستخدام تقنيات SWAR SIMD والتخزين المؤقت لما قبل الترميز.
نشر طالب الدكتوراه في جامعة ستانفورد مارسيل رود أداة Gigatoken، وهي مُرمِّز (tokenizer) يعتمد على ترميز أزواج البايتات (BPE)، مكتوب بلغة راست مع روابط بايثون، بموجب ترخيص MIT. على نظام ثنائي المعالجات AMD EPYC 9565 ذو 144 نواة، عالجت Gigatoken مجموعة بيانات owt_train.txt بحجم 11.9 جيجابايت بمعدل 24.53 جيجابايت/ثانية، مقارنةً بمُرمِّزات HuggingFace التي بلغت سرعتها 24.8 ميجابايت/ثانية (أبطأ بمقدار 989 ضعفًا) ومُرمِّز tiktoken من OpenAI بسرعة 36.0 ميجابايت/ثانية (أبطأ بمقدار 681 ضعفًا). على معالج Apple M4 Max ذو 16 نواة، حققت سرعة 8.79 جيجابايت/ثانية، متفوقةً على HuggingFace بمقدار 1,268 ضعفًا وعلى tiktoken بمقدار 140 ضعفًا. تأتي مكاسب الأداء من مُرمِّز أولي (pretokenizer) مكتوب يدويًا يستخدم تقنيات SWAR (SIMD Within A Register) للتحقق من 8 بايتات في وقت واحد عبر حسابات غير شرطية (branchless arithmetic)، محققًا سرعة 1,049 ميجابايت/ثانية لعملية الترميز الأولي الخاص بـ GPT-2 — وهو تحسين بنسبة 22.3 ضعفًا مقارنةً بالأساليب المعتمدة على التعبيرات النمطية (regex). بالإضافة إلى ذلك، يتجنب التخزين المؤقت للترميز الأولي (pretoken caching) إعادة حساب الكلمات التي شوهدت سابقًا. يحقق وضع التوافق مع مُرمِّزات HuggingFace أو tiktoken الحالية تسريعًا بمقدار 200–300 ضعفًا بسبب الحمل الزائد للغة بايثون. أكدت المقاييس المستقلة على منصة KrabArena باستخدام جهاز افتراضي (VM) بمعالج رباعي النوى (4 vCPUs) معدل إنتاجية وسطيًا بلغ 277.8 ميجابايت/ثانية، متفوقةً على tiktoken بمقدار 26.2 ضعفًا ومُرمِّزات HuggingFace بمقدار 83.4 ضعفًا. تدعم المكتبة 23 عائلة من المُرمِّزات بما في ذلك GPT-2 و Llama 3-4 و Qwen 2-3.6 و DeepSeek V3/R1/V4 و GLM 4/5 و Kimi K2 و Nemotron 3 و Phi-4 و OLMo 2/3 و ModernBERT و Gemma و Mistral، لكن مُرمِّزات SentencePiece تحقق تسريعًا بمقدار 7–22 ضعفًا فقط، ولا تدعم WordPiece.
المصدر: MarkTechPost —
الأصلي
