OPPO's on-device multimodale LLM-engineeringpraktijk op AICon Shenzhen
OPPO
MediaTek
Qualcomm
Dr. Xiyu Yu, multimodale algoritme-expert bij OPPO, zal op AICon Shenzhen 2026 de full-stack engineeringpraktijk van OPPO voor on-device multimodale grote taalmodellen delen. De presentatie behandelt quantization-aware training (QAT), sparse compressie, long-context cache-eviction, decodingversnelling en geautomatiseerde QALFT-pijplijnen om problemen met inferentielatentie, engineeringcomplexiteit en personalisatie op resource-beperkte apparaten aan te pakken.
Dr. Xiyu Yu van OPPO bevestigt zijn spreken op de AICon Shenzhen 2026-conferentie over het onderwerp van on-device multimodale grote taalmodellen (LLM) engineeringpraktijk. Zijn lezing behandelt kernuitdagingen zoals prefill/decoding-latentie in lang-contextscenario's, complexe engineeringpijplijnen van trainingscompressie tot implementatie, en problemen bij modeliteratie en personalisatie. De full-stack-aanpak van OPPO omvat een modulair QAT-trainingsframework dat sparse training, eviction-aware QAT en decodingacceleratie integreert. Een geautomatiseerde QALFT-pijplijn omvat datavoorbereiding, PTQ/QAT, QALFT-finetuning, nauwkeurigheidsvalidatie en prestatieprofilering op MTK- en Qualcomm-platforms. Zero-order optimalisatie met behulp van sparse perturbatie maakt on-device training mogelijk voor privacybehoudende personalisatie. De praktijk is toegepast in meer dan 10 verticale bedrijfsscenario's en ondersteunt snelle iteratie van on-device agent-mogelijkheden. Toekomstige richtingen omvatten efficiënte aandacht en KV-cachebeheer voor langere contexten, kwantisatie met lagere bitbreedte en geünificeerde optimalisatie van multimodaal begrip en agentplanning. De conferentie vindt plaats op 21-22 augustus 2026 en telt 50+ experts van toptechnologiebedrijven.
Bron: InfoQ 中国 —
origineel
