Hardware e Inferência RSS

Hardware e Inferência 🇨🇳

AMD apresenta Helios com a primeira GPU de 2nm do mundo, MI455X: OpenAI, Meta e Microsoft entre os clientes

A AMD lançou o sistema em escala de rack Helios, com o acelerador Instinct MI455X, anunciado como a primeira GPU com chiplets de 2nm. Os clientes incluem OpenAI, Meta, Microsoft e Oracle, com remessas previstas a partir do terceiro trimestre de 2026. O sistema utiliza uma arquitetura aberta com UALink e Ultra Ethernet, visando desafiar o domínio da Nvidia.

OpenAIOpenAI MetaMeta MicrosoftMicrosoft OracleOracle AnthropicAnthropic Taiwan Semiconductor Manufacturing CompanyTaiwan Semiconductor Manufacturing Company
InfoQ 中国27.07 · 06:02

Google Acelera Modelos Gemini Nano no Pixel com Predição de Múltiplos Tokens Congelada

A Google introduziu um método para adaptar a Predição de Múltiplos Tokens (MTP) em modelos de produção congelados, como o Gemini Nano v3, permitindo inferência no dispositivo mais rápida nos dispositivos Pixel 9 e 10. O cabeçalho MTP se conecta às camadas finais do modelo principal, aproveitando seus estados ocultos e cache KV para gerar múltiplos tokens por passagem de inferência sem modelos de rascunho separados, alcançando acelerações de 50% ou mais e reduzindo o consumo de memória em 130 MB por instância.

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google Research27.07 · 05:05
Notícias frescas