ИсследованияМодели 🇨🇳 28.07.2026 16:03

Глобальная балансировка нагрузки батчей: почти бесплатный обед для улучшения обучения MoE LLM

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen предлагает метод глобальной балансировки нагрузки батчей для моделей смеси экспертов (MoE), который преодолевает ограничения балансировки на уровне микро-батчей за счет синхронизации частот выбора экспертов по всем микро-батчам. Эксперименты показывают улучшение производительности и специализации экспертов для различных размеров моделей и конфигураций данных.
Архитектура смеси экспертов (Mixture-of-Experts, MoE) — популярный метод масштабирования параметров модели, но существующие фреймворки для обучения, такие как Megatron-core, используют балансировку потерь на уровне микробатчей, что может ухудшать производительность, если микробатчи содержат однородные данные (например, только код). Alibaba Qwen предлагает глобальную балансировку потерь на уровне
Показать ещё ↓
Источник: Alibaba Qwen — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости