OPPO在AICon深圳分享端侧多模态大模型工程实践
OPPO
MediaTek
Qualcomm
OPPO多模态算法专家余熙宇博士将在2026年AICon深圳大会上分享OPPO在端侧多模态大模型上的全栈工程实践。内容涵盖量化感知训练(QAT)、稀疏压缩、长上下文缓存淘汰、解码加速以及自动化QALFT流水线,旨在解决资源受限设备上的推理延迟、工程复杂性和个性化问题。
OPPO 的余熙宇博士已确认将在 2026 年深圳 AICon 大会上发表演讲,主题为端侧多模态大语言模型(LLM)工程实践。他的演讲将聚焦长上下文场景下的预填充/解码延迟、从训练压缩到部署的复杂工程流水线,以及模型迭代与个性化等核心挑战。OPPO 的全局方案包含一个模块化的 QAT 训练框架,集成了稀疏训练、逐出感知 QAT 和解码加速。自动化的 QALFT 流水线覆盖数据准备、PTQ(训练后量化)/QAT(量化感知训练)、QALFT 微调、精度验证以及跨 MTK 和高通平台的性能分析。利用稀疏扰动的零阶优化可实现端侧训练,以支持隐私保护下的个性化。该实践已应用于超过 10 个垂直业务场景,支撑了端侧智能体能力的快速迭代。未来方向包括:针对更长上下文的高效注意力机制和 KV 缓存管理、更低比特量化,以及多模态理解与智能体规划的统一优化。大会将于 2026 年 8 月 21 日至 22 日举行,预计将有来自顶尖科技公司的 50 余位专家出席。
来源: InfoQ 中国 —
原文
