на последовательностях до 256K токенов, а затем с помощью экстраполяции длины (Dual Chunk Attention) расширены до 1M. В тестах на извлечение пароля (Passkey Retrieval) и сложных задачах (RULER, LV-Eval, LongBench) модели значительно превзошли версии с 128K и GPT-4o-mini. Для инференса рекомендуется GPU с архитектурой Ampere или Hopper, не менее 120 ГБ VRAM для 7B и 320 ГБ для 14B. Также представлен Qwen Chat — AI-ассистент с поддержкой длинного контекста.