Qwen2.5-Max: изучение возможностей крупномасштабной модели MoE
Alibaba/Qwen
Alibaba Qwen выпустила Qwen2.5-Max — большую языковую модель на основе архитектуры Mixture-of-Experts, обученную на более чем 20 триллионах токенов. Модель превосходит DeepSeek V3 по нескольким бенчмаркам и доступна через API Alibaba Cloud и Qwen Chat.
Команда Qwen выпустила Qwen2.5-Max — большую языковую модель на основе архитектуры смеси экспертов (MoE, Mixture-of-Experts), предварительно обученную на более чем 20 триллионах токенов. После предварительного обучения были применены контролируемая тонкая настройка (SFT, supervised fine-tuning) и обучение с подкреплением на основе обратной связи от человека (RLHF, reinforcement learning from
Показать ещё ↓
Источник: Alibaba Qwen —
оригинал
