GPT-4 (91,6 балла) и GLM4-9B-1M (89,9 балла). Благодаря технологии разреженного внимания время до первого токена при контексте в 1 млн токенов сокращается с 4,9 минут до 68 секунд, что даёт ускорение в 4,3 раза. Цена остаётся на уровне ¥0,3 за 1 млн токенов, что позволяет Qwen2.5-Turbo обрабатывать в 3,6 раза больше токенов, чем GPT-4o-mini, при тех же затратах. Модель сохраняет конкурентоспособные возможности при коротких последовательностях, находясь на одном уровне с GPT-4o-mini. Она доступна через API Alibaba Cloud Model Studio, демо-версию на HuggingFace и ModelScope.