⚡ 속보
오픈 소스하드웨어 및 추론 🇺🇸 24.07.2026 01:03

Gigatoken: Rust 기반 BPE 토크나이저, 초당 24.53GB 인코딩 속도로 HuggingFace 토크나이저보다 최대 989배 빠름

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA MicrosoftMicrosoft Allen Institute for AIAllen Institute for AI Answer.AIAnswer.AI MistralMistral
Gigatoken은 스탠퍼드 박사 과정 학생인 Marcel Rød가 Rust로 작성한 BPE 토크나이저로, 144코어 AMD EPYC 시스템에서 초당 24.53GB의 텍스트 인코딩 속도를 달성하여 HuggingFace 토크나이저보다 989배, OpenAI의 tiktoken보다 681배 빠릅니다. 이 라이브러리는 23개의 토크나이저 패밀리를 지원하며, SWAR SIMD 기술을 사용한 수동 최적화된 사전토크나이저와 사전토큰 캐싱 덕분에 이러한 속도를 실현했습니다.
스탠포드 박사 과정 학생인 Marcel Rød이 MIT 라이선스 하에 Rust로 작성되고 Python 바인딩이 포함된 바이트 페어 인코딩(BPE) 토크나이저인 Gigatoken을 출시했습니다. 144코어 AMD EPYC 9565 듀얼 소켓 시스템에서 Gigatoken은 11.9GB의 owt_train.txt 코퍼스를 24.53GB/s로 처리한 반면, HuggingFace 토크나이저는 24.8MB/s(989배 느림), OpenAI의 tiktoken은 36.0MB/s(681배 느림)를 기록했습니다. 16코어 Apple M4 Max에서는 8.79GB/s를 달성하여 HuggingFace보다 1,268배, tiktoken보다 140배 빠른 성능을 보였습니다. 이러한 성능 향상은 SWAR(SIMD Within A Register) 기술을 사용하여 분기 없는 산술 연산으로 8바이트를 한 번에 검사하는 수동 작성 프리토크나이저에서 비롯되며, GPT-2 프리토크나이제이션에서 1,049MiB/s를 달성해 정규 표현식 기반 방식보다 22.3배 개선되었습니다. 또한, 프리토큰 캐싱을 통해 이전에 등장한 단어의 재연산을 방지합니다. 기존 HuggingFace 또는 tiktoken 토크나이저와의 호환성 모드에서는 Python 오버헤드로 인해 200~300배의 속도 향상을 보입니다. 4-vCPU VM을 사용한 KrabArena의 독립 벤치마크에서 중간 처리량은 277.8MB/s로, tiktoken보다 26.2배, tokenizers보다 83.4배 빠른 성능을 확인했습니다. 이 라이브러리는 GPT-2, Llama 3–4, Qwen 2–3.6, DeepSeek V3/R1/V4, GLM 4/5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma, Mistral을 포함한 23개의 토크나이저 패밀리를 지원하지만, SentencePiece 토크나이저는 7~22배의 속도 향상에 그치고 WordPiece는 지원되지 않습니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스