모델오픈 소스 🇺🇸 27.07.2026 12:03

Google DeepMind, Gemma 4 12B 공개: 인코더 없는 통합 멀티모달 모델

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind가 중간 규모 멀티모달 AI 모델인 Gemma 4 12B를 공개했습니다. 이 모델은 별도의 인코더 없이 시각 및 오디오 데이터를 직접 처리합니다. 16GB RAM의 노트북에서 실행 가능하도록 설계되었으며, 고급 추론 및 에이전트 기능을 제공합니다. Apache 2.0 라이선스로 출시되었으며, Hugging Face, Ollama, Google Cloud 등 개발자 도구를 지원합니다.
Google DeepMind이 Gemma 4 12B를 발표했습니다. 이는 비전 및 오디오 입력을 위한 전용 인코더 없이 LLM 백본이 직접 처리할 수 있는 통합 멀티모달 모델입니다. 16GB의 VRAM 또는 통합 메모리를 갖춘 소비자용 노트북에서 로컬 실행이 가능하도록 설계되었으며, 더 큰 26B MoE 모델에 근접한 성능을 제공하면서도 더 작은 메모리 공간을 자랑합니다. 주요 기능으로는 네이티브 오디오 입력, 지연 시간 감소를 위한 다중 토큰 예측 드래프터, Apache 2.0 라이선스가 포함됩니다. 이 모델은 Hugging Face와 Kaggle에서 다운로드할 수 있으며, LM Studio, Ollama, Google Cloud와 같은 도구와의 통합을 지원합니다. Gemma 4 모델은 1억 5천만 회 다운로드를 돌파했습니다.
출처: Google DeepMind — 원문
관련 게시물 ↓
새로운 뉴스