Google DeepMind giới thiệu Gemma 4 12B: mô hình đa phương thức hợp nhất không cần bộ mã hóa
Google/DeepMind
Google DeepMind
Google DeepMind vừa công bố Gemma 4 12B, một mô hình AI đa phương thức tầm trung có khả năng xử lý trực tiếp hình ảnh và âm thanh mà không cần bộ mã hóa riêng. Được thiết kế để chạy trên máy tính xách tay với RAM 16GB, mô hình này cung cấp các khả năng suy luận nâng cao và tác nhân. Mô hình được phát hành theo giấy phép Apache 2.0 và hỗ trợ các công cụ phát triển như Hugging Face, Ollama và Google Cloud.
Google DeepMind công bố Gemma 4 12B, một mô hình đa phương thức thống nhất không sử dụng bộ mã hóa chuyên dụng cho đầu vào hình ảnh và âm thanh, cho phép xử lý trực tiếp bởi nhánh chính của mô hình ngôn ngữ lớn (LLM). Mô hình được thiết kế để chạy cục bộ trên các máy tính xách tay tiêu dùng có 16GB VRAM hoặc bộ nhớ thống nhất, mang lại hiệu suất gần bằng mô hình MoE 26B lớn hơn nhưng với bộ nhớ chiếm dụng nhỏ hơn. Các tính năng chính bao gồm đầu vào âm thanh gốc, bộ soạn thảo Dự đoán Đa Token để giảm độ trễ, và giấy phép Apache 2.0. Mô hình có sẵn để tải xuống trên Hugging Face và Kaggle, đồng thời hỗ trợ tích hợp với các công cụ như LM Studio, Ollama và Google Cloud. Các mô hình Gemma 4 đã vượt qua 150 triệu lượt tải xuống.
Nguồn: Google DeepMind —
bản gốc
