Pratique d'ingénierie du LLM multimodal embarqué d'OPPO à l'AICon Shenzhen
OPPO
MediaTek
Qualcomm
Dr. Xiyu Yu, expert en algorithmes multimodaux chez OPPO, partagera la pratique d'ingénierie complète d'OPPO pour les grands modèles de langage multimodaux embarqués à l'AICon Shenzhen 2026. La présentation couvre l'entraînement conscient de la quantification (QAT), la compression sparse, l'éviction de cache en contexte long, l'accélération du décodage et les pipelines QALFT automatisés pour résoudre la latence d'inférence, la complexité d'ingénierie et la personnalisation sur des dispositifs aux ressources limitées.
Le Dr Xiyu Yu d'OPPO est confirmé pour intervenir à la conférence AICon Shenzhen 2026 sur le thème de la pratique d'ingénierie des grands modèles de langage multimodaux sur appareil. Son exposé abordera les défis fondamentaux tels que la latence de pré-remplissage et de décodage dans les scénarios à contexte long, les pipelines d'ingénierie complexes allant de la compression à l'entraînement jusqu'au déploiement, ainsi que les difficultés liées à l'itération des modèles et à la personnalisation. L'approche full-stack d'OPPO comprend un cadre d'entraînement QAT modulaire intégrant l'entraînement parcimonieux, le QAT tenant compte de l'éviction et l'accélération du décodage. Un pipeline automatisé de QALFT couvre la préparation des données, la quantification post-entraînement (PTQ), le QAT, le fine-tuning QALFT, la validation de la précision et le profilage des performances sur les plateformes MTK et Qualcomm. L'optimisation de zéro ordre utilisant des perturbations parcimonieuses permet l'entraînement sur appareil pour une personnalisation préservant la vie privée. Cette pratique a été appliquée à plus de dix scénarios métier verticaux, prenant en charge l'itération rapide des capacités des agents sur appareil. Les orientations futures incluent une attention efficace et une gestion du cache KV pour des contextes plus longs, une quantification à largeur de bit plus faible, et une optimisation unifiée de la compréhension multimodale et de la planification des agents. La conférence se déroulera les 21 et 22 août 2026, avec plus de 50 experts des plus grandes entreprises technologiques.
Source: InfoQ 中国 —
original
