OPPO의 AICon 선진에서의 온디바이스 멀티모달 LLM 엔지니어링 실무
OPPO
MediaTek
Qualcomm
OPPO의 멀티모달 알고리즘 전문가인 Xiyu Yu 박사가 AICon 선진 2026에서 온디바이스 멀티모달 대규모 언어 모델을 위한 OPPO의 풀스택 엔지니어링 실무를 공유합니다. 이 발표는 양자화 인식 훈련(QAT), 희소 압축, 장문맥 캐시 제거, 디코딩 가속화, 자동화된 QALFT 파이프라인을 다루어, 리소스 제약이 있는 기기에서의 추론 지연 시간, 엔지니어링 복잡성, 개인화 문제를 해결합니다.
OPPO의 위시위(Xiyu Yu) 박사가 AICon 선전 2026 컨퍼런스에서 온디바이스 멀티모달 대규모 언어 모델 엔지니어링 실무를 주제로 발표할 예정입니다. 그의 강연은 긴 맥락 시나리오에서의 프리필/디코딩 지연 시간, 훈련 압축에서 배포에 이르는 복잡한 엔지니어링 파이프라인, 모델 반복 및 개인화의 어려움과 같은 핵심 과제를 다룹니다. OPPO의 풀스택 접근 방식은 희소 훈련, 제거 인식 양자화 인식 훈련, 디코딩 가속을 통합한 모듈식 양자화 인식 훈련(QAT) 프레임워크를 포함합니다. 자동화된 양자화-인식 저순위 적응(QALFT) 파이프라인은 데이터 준비, 사후 훈련 양자화(PTQ)/QAT, QALFT 미세 조정, 정확도 검증, MTK 및 Qualcomm 플랫폼 간 성능 프로파일링을 포함합니다. 희소 섭동을 이용한 제로차 최적화는 프라이버시를 보호하는 개인화를 위한 온디바이스 훈련을 가능하게 합니다. 이 실무는 10개 이상의 수직 비즈니스 시나리오에 적용되어 온디바이스 에이전트 기능의 신속한 반복을 지원합니다. 향후 방향으로는 긴 맥락을 위한 효율적인 어텐션 및 KV 캐시 관리, 더 낮은 비트 폭 양자화, 멀티모달 이해와 에이전트 계획의 통합 최적화가 포함됩니다. 컨퍼런스는 2026년 8월 21일부터 22일까지 열리며, 주요 기술 기업의 50명 이상의 전문가가 참여합니다.
출처: InfoQ 中国 —
원문
