human feedback). Модель сравнивалась с DeepSeek V3, GPT-4o и Claude-3.5-Sonnet на тестах MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard и GPQA-Diamond. Qwen2.5-Max превзошла DeepSeek V3 в Arena-Hard, LiveBench, LiveCodeBench и GPQA-Diamond, показав конкурентоспособные результаты в MMLU-Pro. Для базовых моделей проводилось сравнение с DeepSeek V3, Llama-3.1-405B и Qwen2.5-72B — Qwen2.5-Max продемонстрировала значительные преимущества в большинстве тестов. Модель доступна в Qwen Chat и через API Alibaba Cloud (имя модели: qwen-max-2025-01-25). API совместим с API OpenAI.