DiffusionGemma: Tăng tốc sinh văn bản lên gấp 4 lần
Google/DeepMind
DeepMind
NVIDIA
Google DeepMind đã giới thiệu DiffusionGemma, một mô hình hỗn hợp chuyên gia (Mixture of Experts) nguồn mở thử nghiệm với 26B tham số, sử dụng khuếch tán văn bản để tạo ra nội dung nhanh hơn tới 4 lần so với các mô hình ngôn ngữ lớn tự hồi quy trên GPU. Mô hình xử lý đồng thời các khối 256 token, hướng tới các quy trình làm việc cục bộ yêu cầu tốc độ cao như chỉnh sửa nội tuyến, và được phát hành theo giấy phép Apache 2.0 trên Hugging Face.
Google DeepMind vừa phát hành DiffusionGemma, một mô hình Mixture of Experts (MoE) thử nghiệm với 26 tỷ tham số theo giấy phép Apache 2.0, giúp tăng tốc độ sinh văn bản lên đến 4 lần nhờ sử dụng phương pháp dựa trên khuếch tán (diffusion) thay vì dự đoán token tuần tự. Mô hình chỉ kích hoạt 3,8 tỷ tham số cho mỗi suy luận, phù hợp trong 18GB VRAM khi lượng tử hóa, và đạt hơn 1000 token mỗi giây trên NVIDIA H100 cùng 700+ token trên GeForce RTX 5090. Nó sử dụng cơ chế chú ý hai chiều (bi-directional attention) để sinh 256 token song song, cho phép thực hiện các tác vụ phi tuyến tính như điền mã (code infilling) và giải Sudoku. DiffusionGemma được tối ưu cho suy luận nội bộ với độ đồng thời thấp, nơi giải mã song song mang lại lợi ích tối đa, trong khi các mô hình tự hồi quy vẫn phù hợp hơn cho phục vụ đám mây với QPS cao. Mô hình tinh chỉnh đầu ra một cách lặp đi lặp lại, và có thể được tinh chỉnh bằng các công cụ như Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo, với hỗ trợ llama.cpp sắp tới. Google DeepMind đã hợp tác với NVIDIA để tối ưu hóa phần cứng bao gồm kernel NVFP4, và mô hình hiện có sẵn trên Hugging Face, nền tảng Gemini Enterprise Agent và NVIDIA NIM.
Nguồn: Google DeepMind —
bản gốc
