Praktik Rekayasa Multimodal LLM On-Device OPPO di AICon Shenzhen
OPPO
MediaTek
Qualcomm
Dr. Xiyu Yu, pakar algoritma multimodal di OPPO, akan membagikan praktik rekayasa penuh untuk model bahasa besar multimodal on-device di AICon Shenzhen 2026. Pembahasan mencakup pelatihan sadar kuantisasi (QAT), kompresi sparse, pengusiran cache konteks panjang, akselerasi decoding, dan pipeline QALFT otomatis untuk mengatasi latensi inferensi, kompleksitas rekayasa, serta personalisasi pada perangkat dengan sumber daya terbatas.
Dr. Xiyu Yu dari OPPO dikonfirmasi akan berbicara di konferensi AICon Shenzhen 2026 dengan topik praktik rekayasa model bahasa besar multimodal (LLM) pada perangkat. Pidatonya akan membahas tantangan inti seperti latensi prefill/decoding dalam skenario konteks panjang, pipeline rekayasa kompleks dari kompresi pelatihan hingga penyebaran, serta kesulitan dalam iterasi dan personalisasi model. Pendekatan full-stack OPPO mencakup kerangka kerja pelatihan QAT modular yang mengintegrasikan pelatihan sparse, QAT yang sadar eviction, dan akselerasi decoding. Pipeline QALFT otomatis mencakup persiapan data, PTQ/QAT, penyesuaian halus QALFT, validasi akurasi, dan pembuatan profil kinerja di seluruh platform MTK dan Qualcomm. Optimasi orde-nol menggunakan gangguan sparse memungkinkan pelatihan pada perangkat untuk personalisasi yang menjaga privasi. Praktik ini telah diterapkan di lebih dari 10 skenario bisnis vertikal, mendukung iterasi cepat kemampuan agen pada perangkat. Arah masa depan mencakup attention dan manajemen cache KV yang efisien untuk konteks yang lebih panjang, kuantisasi lebar bit yang lebih rendah, dan optimasi terpadu pemahaman multimodal dan perencanaan agen. Konferensi akan berlangsung pada 21-22 Agustus 2026, dengan menghadirkan 50+ pakar dari perusahaan teknologi terkemuka.
Sumber: InfoQ 中国 —
asli
