батча, которая синхронизирует частоту выбора экспертов во всех параллельных группах и вычисляет потери глобально. Эксперименты с тремя конфигурациями MoE (3,4 млрд / 0,6 млрд активированных параметров, 15 млрд / 2,54 млрд активированных параметров, 43 млрд / 6,6 млрд активированных параметров) и обучением на 400 миллиардах токенов показывают, что глобальная балансировка на уровне батча стабильно превосходит балансировку на уровне микробатча на различных задачах. Она также приводит к значительной специализации экспертов по доменам, что отсутствует в моделях с балансировкой на уровне микробатча. Добавление небольшой балансировки потерь на уровне микробатча (вес 0,01) поверх глобальной балансировки ускоряет обучение, не влияя на эффективность. Этот метод почти бесплатен, поскольку синхронизация затрагивает только один вектор, размер которого равен числу экспертов. Работа опубликована в препринте arXiv 2501.11873.