Prática de Engenharia de LLM Multimodal no Dispositivo da OPPO no AICon Shenzhen
OPPO
MediaTek
Qualcomm
O Dr. Xiyu Yu, especialista em algoritmos multimodais da OPPO, compartilhará a prática de engenharia full-stack da OPPO para modelos de linguagem grandes multimodais no dispositivo no AICon Shenzhen 2026. A palestra abrange treinamento ciente de quantização (QAT), compressão esparsa, remoção de cache de contexto longo, aceleração de decodificação e pipelines QALFT automatizados para lidar com latência de inferência, complexidade de engenharia e personalização em dispositivos com recursos limitados.
O Dr. Xiyu Yu, da OPPO, está confirmado para palestrar na conferência AICon Shenzhen 2026 sobre o tema da prática de engenharia de modelos de linguagem grande multimodais (LLMs, do inglês large language models) no dispositivo. Sua palestra abordará desafios centrais, como latência de preenchimento/decodificação em cenários de contexto longo, pipelines de engenharia complexos desde compressão de treinamento até implantação e dificuldades na iteração e personalização de modelos. A abordagem full-stack da OPPO inclui uma estrutura modular de treinamento QAT (do inglês quantization-aware training, treinamento ciente de quantização) que integra treinamento esparso, QAT ciente de evicção e aceleração de decodificação. Um pipeline automatizado de QALFT (do inglês quantization-aware low-rank fine-tuning, ajuste fino de baixo posto ciente de quantização) cobre preparação de dados, PTQ (do inglês post-training quantization, quantização pós-treinamento), QAT, ajuste fino QALFT, validação de precisão e perfil de desempenho em plataformas MTK e Qualcomm. A otimização de ordem zero usando perturbação esparsa permite treinamento no dispositivo para personalização com preservação de privacidade. A prática foi aplicada a mais de 10 cenários de negócios verticais, suportando iteração rápida de capacidades de agentes no dispositivo. Direções futuras incluem atenção eficiente e gerenciamento de cache KV para contextos mais longos, quantização de largura de bits mais baixa e otimização unificada de compreensão multimodal e planejamento de agentes. A conferência ocorrerá nos dias 21 e 22 de agosto de 2026, com mais de 50 especialistas das principais empresas de tecnologia.
Fonte: InfoQ 中国 —
original
