Hardware e Inferencia RSS

Hardware e Inferencia 🇨🇳

AMD presenta Helios con la primera GPU de 2 nm del mundo MI455X: OpenAI, Meta y Microsoft entre los clientes

AMD ha lanzado el sistema a escala de rack Helios con el acelerador Instinct MI455X, considerado la primera GPU con chiplets de 2 nm. Los clientes incluyen OpenAI, Meta, Microsoft y Oracle, y los envíos están previstos a partir del tercer trimestre de 2026. El sistema utiliza una arquitectura abierta con UALink y Ultra Ethernet, con el objetivo de desafiar el dominio de Nvidia.

OpenAIOpenAI MetaMeta MicrosoftMicrosoft OracleOracle AnthropicAnthropic Taiwan Semiconductor Manufacturing CompanyTaiwan Semiconductor Manufacturing Company
InfoQ 中国27.07 · 06:02

Google acelera los modelos Gemini Nano en Pixel con predicción congelada de múltiples tokens

Google ha presentado un método para adaptar la Predicción de Múltiples Tokens (MTP, por sus siglas en inglés) a modelos de producción congelados como Gemini Nano v3, lo que permite una inferencia en el dispositivo más rápida en los dispositivos Pixel 9 y 10. El cabezal MTP se conecta a las últimas capas del modelo principal, aprovechando sus estados ocultos y caché KV para generar múltiples tokens por paso de inferencia sin necesidad de modelos de drafting separados, logrando aceleraciones del 50 por ciento o más y reduciendo el consumo de memoria en 130 MB por instancia.

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google Research27.07 · 05:05
Noticias frescas