выполнения: переход со сборки на основе vLLM 0.21.1 на сборку с vLLM 0.25.2 дал +22% на том же контрольном примере, увеличив выходные токены на шаг верификации с 3,27 до 4,80. Дополнительный прирост получен при явном указании --moe-backend flashinfer_b12x, поскольку в пользовательском образе B12X исключён из автоматического выбора; это добавило в среднем +13,3% на профиле, близком к реальному (с 59,7 до 67,6 ток/с). Автор также отмечает новый релиз контрольного примера (0731) с улучшенными агентскими бенчмарками и признаёт параллельную работу tonyd2wild над аналогичными оптимизациями.