하드웨어 및 추론모델 🇺🇸 27.07.2026 05:05

Google, 픽셀에서 Frozen Multi-Token Prediction으로 Gemini Nano 모델 가속화

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google은 프로덕션 모델(예: Gemini Nano v3)을 고정(frozen)한 채로 Multi-Token Prediction(MTP)을 개조(retrofit)하는 방법을 도입했습니다. 이를 통해 Pixel 9 및 10 기기에서 온디바이스 추론 속도를 높입니다. MTP 헤드는 주 모델의 최종 레이어에 부착되어, 은닉 상태(hidden states)와 KV 캐시를 활용하여 별도의 드래프트 모델 없이 추론 패스당 여러 토큰을 생성하며, 50% 이상의 속도 향상과 인스턴스당 130MB의 메모리 감소를 달성합니다.
Google Research는 픽셀 스마트폰에서 Gemini Nano v3 같은 온디바이스 언어 모델을 가속화하는 새로운 아키텍처를 발표했습니다. 이 접근 방식은 경량 트랜스포머 헤드를 최종 레이어에 추가하여 동결된 기본 모델에 다중 토큰 예측을 개조하는 방식입니다. 이 MTP 헤드는 교차 어텐션을 통해 기본 모델의 기존 키-값 캐시를 직접 사용하므로, 독립적인 드래프터 모델이 필요 없으며 인스턴스당 메모리 오버헤드를 130MB 줄입니다. AI 알림 요약 및 맞춤법 검사와 같은 프로덕션 작업에서 MTP는 추론 패스당 거의 두 개의 추가 토큰을 생성하여 Pixel 9 기기에서 50% 이상의 속도 향상을 제공합니다. 최종 출력은 기본 모델과 동일하므로 안전성 정렬 및 하위 호환성을 보장합니다. 이 방법은 Pixel 9 및 10 시리즈에 적용되었으며, Google은 추가 효율성 향상을 위해 병렬 디코딩 및 검증 완화를 탐색할 계획입니다.
출처: Google Research — 원문
관련 게시물 ↓
새로운 뉴스