Open SourceModels 🇨🇳 28.07.2026 16:03

Alibaba открывает исходный код Qwen2.5-1M с поддержкой контекста до 1 млн токенов

Alibaba/QwenAlibaba/Qwen
Alibaba выпустила открытые модели Qwen2.5-7B-Instruct-1M и Qwen2.5-14B-Instruct-1M с контекстом до 1 млн токенов, а также оптимизированный фреймворк инференса на базе vLLM. Модели превосходят предыдущие версии и GPT-4o-mini в задачах с длинным контекстом, сохраняя производительность на коротких текстах.
Alibaba Qwen представила открытые модели Qwen2.5-7B-Instruct-1M и Qwen2.5-14B-Instruct-1M, способные обрабатывать контекст до 1 миллиона токенов. Для их развертывания компания полностью открыла фреймворк инференса на основе vLLM, который использует разреженное внимание (sparse attention) и ускоряет обработку 1M-токенов в 3–7 раз. Модели обучались прогрессивно: сначала на последовательностях до 256K токенов, а затем с помощью экстраполяции длины (Dual Chunk Attention) расширены до 1M. В тестах на извлечение пароля (Passkey Retrieval) и сложных задачах (RULER, LV-Eval, LongBench) модели значительно превзошли версии с 128K и GPT-4o-mini. Для инференса рекомендуется GPU с архитектурой Ampere или Hopper, не менее 120 ГБ VRAM для 7B и 320 ГБ для 14B. Также представлен Qwen Chat — AI-ассистент с поддержкой длинного контекста.
Сокращения
GPU = Graphics Processing Unit — графический процессор
MLP = Multilayer Perceptron — многослойный перцептрон
RoPE = Rotary Position Embedding — вращательное позиционное кодирование
VRAM = Video Random Access Memory — видеопамять
Source: Alibaba Qwen — original
Our earlier posts on this topic ↓
Fresh news