Práctica de ingeniería de LLM multimodal en dispositivo de OPPO en AICon Shenzhen
OPPO
MediaTek
Qualcomm
El Dr. Xiyu Yu, experto en algoritmos multimodales de OPPO, compartirá la práctica integral de ingeniería de OPPO para modelos de lenguaje grandes multimodales en dispositivo en AICon Shenzhen 2026. La charla cubre entrenamiento consciente de cuantificación (QAT), compresión dispersa, eliminación de caché de contexto largo, aceleración de decodificación y tuberías automatizadas QALFT para abordar la latencia de inferencia, la complejidad de ingeniería y la personalización en dispositivos con recursos limitados.
El Dr. Xiyu Yu, de OPPO, ha confirmado su participación como orador en la conferencia AICon Shenzhen 2026, donde hablará sobre la práctica de ingeniería de modelos de lenguaje grandes (LLM, por sus siglas en inglés) multimodales en el dispositivo. Su charla abordará desafíos clave como la latencia de prefill/decodificación en escenarios de contexto largo, complejas canalizaciones de ingeniería que van desde la compresión de entrenamiento hasta el despliegue, y dificultades en la iteración y personalización de modelos. El enfoque integral de OPPO incluye un marco de entrenamiento QAT modular que integra entrenamiento disperso, QAT consciente de desalojo y aceleración de decodificación. Una canalización automatizada de QALFT cubre la preparación de datos, PTQ, QAT, ajuste fino QALFT, validación de precisión y perfilado de rendimiento en plataformas MTK y Qualcomm. La optimización de orden cero mediante perturbación dispersa permite el entrenamiento en el dispositivo para una personalización que preserva la privacidad. Esta práctica se ha aplicado a más de diez escenarios de negocio verticales, apoyando la iteración rápida de capacidades de agentes en el dispositivo. Las direcciones futuras incluyen atención eficiente y gestión de caché KV para contextos más largos, cuantización de menor ancho de bit y optimización unificada de la comprensión multimodal y la planificación de agentes. La conferencia se celebrará los días 21 y 22 de agosto de 2026, y contará con más de 50 expertos de las principales empresas tecnológicas.
Fuente: InfoQ 中国 —
original
