более 700 токенов в секунду на NVIDIA GeForce RTX 5090). Модель имеет архитектуру смеси экспертов (Mixture of Experts, MoE) с 26 млрд параметров, но активирует только 3,8 млрд при инференсе, что позволяет уместиться в 18 ГБ видеопамяти при квантизации. Ключевые особенности: двунаправленное внимание (256 токенов за проход), итеративное самокорректирование и фокус на нелинейных задачах, таких как редактирование кода, заполнение пропусков или работа с аминокислотными последовательностями. Однако качество выходных данных ниже, чем у стандартной Gemma 4; разработчикам, которым важна максимальная точность, рекомендуется использовать авторегрессионную версию. DiffusionGemma особенно эффективна при локальном инференсе с низкой конкурентностью; в облаке с высокой пропускной способностью выигрыш снижается. Модель уже доступна для загрузки на Hugging Face, поддерживается в MLX, vLLM, Hugging Face Transformers; планируется интеграция с llama.cpp. DeepMind сотрудничал с NVIDIA для оптимизации на потребительских и корпоративных GPU (GeForce RTX 5090/4090, Hopper, Blackwell, NVIDIA DGX Spark, DGX Station, RTX PRO); поддерживается 4-битный формат NVFP4 для ускорения. Также опубликованы руководство разработчика, визуальное пособие и туториал по дообучению с использованием Hackable Diffusion (JAX).