соблюдения жесткого инварианта, согласно которому каждый ранг получает ровно S×K токенов, что достигается за счет онлайн-планирования избыточных экспертов, извлекаемых до начала вычислений. Дизайн обеспечивает идеальный баланс, онлайн-планирование с помощью GPU-ядра с пренебрежимо малыми накладными расходами, нулевое копирование и статические формы, исключающие синхронизацию хоста на каждом слое. По сравнению с DeepEP v2, в бенчмарках время коммуникации MoonEP остается неизменным при увеличении дисбаланса, тогда как DeepEP деградирует. Для обучения требуется B = E/R слотов предварительной выборки; для инференса можно использовать B = 3–4 без потери корректности.