Aplicações RSS

Pesquisa 🇷🇺

Executando LLMs Locais no iPhone: Memória, Core ML, MLX e Limitações

O artigo explora como executar LLMs locais no iPhone, abordando a arquitetura Apple Silicon, memória unificada, quantização, cache KV, Core ML versus MLX, throttling térmico e um pipeline híbrido. Conclui que modelos locais são justificados apenas para cenários críticos de privacidade ou offline, enquanto modelos em nuvem são superiores em outros casos.

AppleApple MetaMeta
Habr — хаб ИИ31.07 · 04:02

Silk afirma que a inferência de IA exige uma infraestrutura de dados fundamentalmente diferente

À medida que os agentes de IA evoluem de chatbots para fluxos de trabalho autônomos de múltiplas etapas, as cargas de inferência estão sobrecarregando o armazenamento em nuvem tradicional (AWS EBS) com concorrência extrema, picos de leitura e latência de cauda. A Silk defende o armazenamento definido por software que desacopla o desempenho da capacidade para lidar com essas demandas sem depender de réplicas de leitura frágeis ou provisionamento excessivo.

NVIDIANVIDIA SilkSilk
The Register AI/ML31.07 · 02:03
Notícias frescas