Hardware e Inferência RSS

Alibaba Cloud: Chip Zhenwu M890 Adapta-se ao Qwen3.8, Modelo Entra no Bailian para Inferência

A Alibaba Cloud anunciou que seu chip supernó Zhenwu M890 adaptou com sucesso o modelo Qwen3.8, permitindo inferência na plataforma Bailian. O Zhenwu M890 é um chip de IA de nova geração da T-Head, que suporta precisões de FP32 a FP4 e alcança interconexão de 800 GB/s via ICN Switch 1.0, permitindo que uma única instância execute um modelo de 2,4 trilhões de parâmetros.

Alibaba/QwenAlibaba/Qwen
QbitAI 量子位24.07 · 01:03
Código Aberto 🇺🇸

Gigatoken: Tokenizador BPE em Rust Codifica Texto a 24,53 GB/s, Até 989x Mais Rápido que os Tokenizadores HuggingFace

Gigatoken, um tokenizador BPE escrito em Rust pelo estudante de doutorado da Stanford Marcel Rød, atinge velocidades de codificação de texto de 24,53 GB/s em um sistema AMD EPYC de 144 núcleos, superando os tokenizadores HuggingFace em 989x e o tiktoken da OpenAI em 681x. A biblioteca suporta 23 famílias de tokenizadores e atribui sua velocidade a um pré-tokenizador otimizado manualmente usando técnicas SIMD SWAR e cache de pré-tokenização.

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA
MarkTechPost24.07 · 01:03
Notícias frescas