Hardware e Inferencia RSS

Alibaba Cloud: el chip Zhenwu M890 se adapta a Qwen3.8, el modelo se despliega en Bailian para inferencia

Alibaba Cloud anunció que su chip supernodo Zhenwu M890 ha adaptado con éxito el modelo Qwen3.8, permitiendo la inferencia en la plataforma Bailian. El Zhenwu M890 es un chip de inteligencia artificial de nueva generación de T-Head, que soporta precisión de FP32 a FP4 y logra una interconexión de 800 GB/s a través de ICN Switch 1.0, permitiendo que una sola instancia ejecute un modelo de 2,4 billones de parámetros.

Alibaba/QwenAlibaba/Qwen
QbitAI 量子位24.07 · 01:03
Código Abierto 🇺🇸

Gigatoken: tokenizador BPE en Rust codifica texto a 24,53 GB/s, hasta 989 veces más rápido que los tokenizadores de HuggingFace

Gigatoken, un tokenizador BPE escrito en Rust por el estudiante de doctorado de Stanford Marcel Rød, alcanza velocidades de codificación de texto de 24,53 GB/s en un sistema AMD EPYC de 144 núcleos, superando a los tokenizadores de HuggingFace en 989 veces y al tiktoken de OpenAI en 681 veces. La biblioteca admite 23 familias de tokenizadores y atribuye su velocidad a un pretokenizador optimizado manualmente mediante técnicas SIMD SWAR y almacenamiento en caché de pretokens.

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA
MarkTechPost24.07 · 01:03
Noticias frescas