ModelosAgentes 🇨🇳 29.07.2026 06:02

Prática de Engenharia de LLM Multimodal no Dispositivo da OPPO no AICon Shenzhen

OPPOOPPO MediaTekMediaTek QualcommQualcomm
Dr. Xiyu Yu, especialista em algoritmos multimodais da OPPO, compartilhará a prática de engenharia full-stack da OPPO para modelos de linguagem multimodal no dispositivo no AICon Shenzhen 2026. A palestra aborda treinamento ciente de quantização (QAT), compressão esparsa, descarte de cache de contexto longo, aceleração de decodificação e pipelines automatizados de QALFT para lidar com latência de inferência, complexidade de engenharia e personalização em dispositivos com recursos limitados.
O Dr. Xiyu Yu, da OPPO, está confirmado para palestrar na conferência AICon Shenzhen 2026 sobre o tema da prática de engenharia de modelos de linguagem grande multimodais (LLMs, do inglês large language models) no dispositivo. Sua palestra abordará desafios centrais, como latência de preenchimento/decodificação em cenários de contexto longo, pipelines de engenharia complexos desde compressão de treinamento até implantação e dificuldades na iteração e personalização de modelos. A abordagem full-stack da OPPO inclui uma estrutura modular de treinamento QAT (do inglês quantization-aware training, treinamento ciente de quantização) que integra treinamento esparso, QAT ciente de evicção e aceleração de decodificação. Um pipeline automatizado de QALFT (do inglês quantization-aware low-rank fine-tuning, ajuste fino de baixo posto ciente de quantização) cobre preparação de dados, PTQ (do inglês post-training quantization, quantização pós-treinamento), QAT, ajuste fino QALFT, validação de precisão e perfil de desempenho em plataformas MTK e Qualcomm. A otimização de ordem zero usando perturbação esparsa permite treinamento no dispositivo para personalização com preservação de privacidade. A prática foi aplicada a mais de 10 cenários de negócios verticais, suportando iteração rápida de capacidades de agentes no dispositivo. Direções futuras incluem atenção eficiente e gerenciamento de cache KV para contextos mais longos, quantização de largura de bits mais baixa e otimização unificada de compreensão multimodal e planejamento de agentes. A conferência ocorrerá nos dias 21 e 22 de agosto de 2026, com mais de 50 especialistas das principais empresas de tecnologia.
Fonte: InfoQ 中国 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas