Mô hìnhNghiên cứu 🇩🇪 09.08.2026 13:01

Google DiffusionGemma: Báo cáo kỹ thuật giải thích mô hình khuếch tán văn bản nhanh

Google/DeepMindGoogle/DeepMind NVIDIANVIDIA
Google DeepMind đã công bố báo cáo kỹ thuật về DiffusionGemma, một mô hình khuếch tán văn bản tạo ra 256 token song song, đạt khoảng 1.500 token mỗi giây trên Nvidia H100. Mô hình được tạo ra bằng cách chuyển đổi mô hình Gemma 4 hiện có thành mô hình khuếch tán với ít hơn 10% ngân sách token huấn luyện ban đầu. Báo cáo nêu bật cả điểm mạnh của mô hình, như khả năng tự sửa lỗi, và những hạn chế trong lý luận và thông lượng đa người dùng.
Google DeepMind đã công bố báo cáo kỹ thuật về DiffusionGemma, một mô hình được phát hành vào giữa tháng 6, tạo văn bản bằng cách tinh chỉnh các khối 256 token song song, tương tự như việc tạo hình ảnh từ nhiễu. Trên bộ tăng tốc H100 của Nvidia, mô hình đạt khoảng 1.500 token mỗi giây. Thay vì huấn luyện từ đầu, mô hình Gemma-4-26B-A4B hiện có đã được chuyển đổi thành mô hình khuếch tán với chưa đến 10% ngân sách token huấn luyện ban đầu. Quá trình huấn luyện bao gồm hai giai đoạn: đầu tiên, học cách tái tạo các khối văn bản bị nhiễu, sau đó là giai đoạn kết hợp giữa học tăng cường và chưng cất bộ lấy mẫu, mà Google gọi là SD·RL. Báo cáo cho biết phương pháp này cải thiện các điểm chuẩn suy luận trung bình mười điểm trong khi tăng gần gấp bốn lần số token mỗi bước, và các phản hồi ngắn hơn khoảng 50%. Xử lý hai chiều của DiffusionGemma cho phép tự sửa lỗi trước khi đưa ra đầu ra, giúp nó giải được câu đố Sudoku với độ chính xác 85% sau khi tinh chỉnh, trong khi mô hình cơ sở không làm được. Nó cũng giữ khả năng tạo từng từ một, cho phép người dùng chuyển đổi chế độ. Tuy nhiên, hiệu suất tuyệt đối thấp hơn mô hình tự hồi quy do các yếu tố như chuyển đổi sau khi huấn luyện và giai đoạn huấn luyện ngắn nhằm mục tiêu tốc độ. Mô hình đôi khi rơi vào vòng lặp lặp lại và có thể không đóng các phần suy luận, làm giảm điểm chuẩn. Lợi thế về tốc độ chủ yếu áp dụng trong các tình huống một người dùng, vì các mô hình tự hồi quy bắt kịp về thông lượng khi có hơn 32 yêu cầu đồng thời. Google định vị DiffusionGemma là mô hình thử nghiệm, nhằm thúc đẩy nghiên cứu và cung cấp cơ sở cho các điều chỉnh chuyên biệt. Mô hình đã được startup Interfaze sử dụng cho nhận dạng giọng nói đa ngôn ngữ và trong một dự án về báo cáo X-quang tương tác. Mô hình có sẵn theo giấy phép Apache 2.0 trên Hugging Face, và một phiên bản tiền thân, Gemini Diffusion, đã được trình diễn vào tháng 5 năm 2025.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới