ИсследованияМодели 🇨🇳 28.07.2026 16:03

Глобальная балансировка загрузки батчей: почти бесплатный обед для улучшения обучения MoE LLM

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen предлагает метод глобальной балансировки загрузки батчей для моделей смеси экспертов (MoE), который преодолевает ограничения балансировки на уровне микробатчей путем синхронизации частот выбора экспертов по всем микробатчам. Эксперименты показывают улучшение производительности и специализации экспертов для различных размеров моделей и конфигураций данных.
Архитектура смеси экспертов (Mixture-of-Experts, MoE) — популярный метод масштабирования параметров модели, но существующие фреймворки для обучения, такие как Megatron-core, используют балансировку потерь на уровне микробатчей, что может ухудшать производительность, если микробатчи содержат однородные данные (например, только код). Alibaba Qwen предлагает глобальную балансировку потерь на уровне
Показать ещё ↓
Источник: Alibaba Qwen — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости