Hardware e InferênciaCódigo Aberto 🇨🇳 29.07.2026 06:01

Infraestrutura de IA Enfrenta Novos Desafios: Modelos Crescem, Computação Heterogênea e Complexidade de Agentes Remodelam o Campo

HuaweiHuawei 4Paradigm (Fourth Paradigm)4Paradigm (Fourth Paradigm) DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Cosmos (NVIDIA)Cosmos (NVIDIA) Google/DeepMindGoogle/DeepMind MetaMeta AnthropicAnthropic
À medida que as arquiteturas de modelos de IA se tornam cada vez mais complexas e diversas, a infraestrutura de IA deve se adaptar à computação heterogênea, pipelines multi-modelo e cargas de trabalho crescentes orientadas por agentes. Especialistas da Huawei, Inferact vLLM e 4Paradigm discutem os principais desafios: gerenciar diversos aceleradores de IA (NVIDIA, Ascend, Cambricon, etc.), otimizar inferência multimodal e como a IA pode eventualmente automatizar grande parte do gerenciamento da infraestrutura, deslocando os engenheiros da implementação para o planejamento e definição de acordos de nível de serviço (SLA).
Em uma discussão ao vivo recente do InfoQ, o diretor de ecologia de código aberto da Huawei AI, Huang Zhipeng, recebeu o committer do Inferact vLLM, Mo Zifeng, e o especialista em desenvolvimento de sistemas da 4Paradigm (Fourth Paradigm), Yang Shouren, para examinar a evolução da infraestrutura de IA. Mo observou que as arquiteturas de modelos estão crescendo muito mais rápido do que as cadeias de ferramentas, com exemplos como o complexo MoE do DeepSeek V4 e os modelos multimodais evoluindo do LLaVA para o Cosmos V full-modal. Yang destacou o desafio central do gerenciamento de computação heterogênea à medida que os aceleradores de IA nacionais proliferam (NVIDIA, Ascend, Cambricon, Kunlun, Tianshu, Muxi), causando problemas de consistência onde um tensor de saída pode falhar em determinadas formas em uma GPU específica. Yang apresentou o HAMi, um projeto de código aberto para virtualização e compartilhamento de GPUs entre dispositivos, e discutiu as limitações do Kubernetes DRA (Dynamic Resource Allocation) para gerenciamento avançado de dispositivos. O grupo também explorou o impacto de agentes de IA nas comunidades de código aberto: os agentes agora ajudam com tarefas mecânicas de PR, mas também inundam repositórios com submissões de baixa qualidade que os committers precisam triar manualmente. Mo descreveu a adoção de uma estratégia de filtragem 'apenas humanos' via verificação de e-mail corporativo/acadêmico. Olhando para o futuro, Yang previu que a IA gradualmente assumirá as operações de infraestrutura, liberando engenheiros para se concentrarem no design de SLA (Acordo de Nível de Serviço), SLO (Objetivo de Nível de Serviço) e custos de nível superior, mas observou que os projetos de código aberto devem manter a confiança na qualidade por meio de testes abrangentes. Mo acrescentou que o software do tipo plataforma continuará essencial, porque mesmo agentes poderosos se beneficiam das otimizações coletivas do ecossistema, e o 'efeito Mateus' concentrará o uso em torno de projetos bem mantidos, como o vLLM. A conversa foi encerrada com conselhos práticos sobre como lidar com operadores de hardware não suportados: suporte do fornecedor, descarregamento para CPU (offload) ou criação de perfil iterativo usando agentes, embora bugs de caso extremo permaneçam difíceis de detectar.
Fonte: InfoQ 中国 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas