Qwen2.5-Turbo: контекст до 1M токенов, ускорение в 4.3 раза
Alibaba/Qwen
Alibaba Cloud выпустила Qwen2.5-Turbo с поддержкой контекста до 1 миллиона токенов, что в 8 раз больше предыдущей версии. Модель достигает 100% точности в задаче Passkey Retrieval на 1M токенов и превосходит GPT-4 по бенчмарку RULER (93.1 против 91.6). Скорость первого токена ускорена в 4.3 раза благодаря разреженному вниманию, цена сохранена на уровне ¥0.3 за 1M токенов.
Alibaba Cloud анонсировала Qwen2.5-Turbo — обновление языковой модели Qwen2.5 с расширенным контекстным окном до 1 миллиона токенов, что эквивалентно примерно 1 миллиону английских слов или 1,5 миллионам китайских иероглифов (10 романов, 150 часов стенограмм или 30 000 строк кода). В тесте Passkey Retrieval на 1M токенов модель достигла 100% точности, а на бенчмарке RULER для длинных текстов набрала 93.1 балла, превзойдя GPT-4 (91.6) и GLM4-9B-1M (89.9). При этом короткие тексты обрабатываются на уровне GPT-4o-mini, без потери качества. Скорость первого токена (time to first token) при обработке 1M токенов сократилась с 4.9 минут до 68 секунд — ускорение в 4.3 раза, достигнутое за счёт разреженных механизмов внимания. Цена осталась прежней: ¥0.3 за 1 млн токенов, что делает Qwen2.5-Turbo в 3.6 раза выгоднее GPT-4o-mini. Модель доступна через API Alibaba Cloud Model Studio, HuggingFace Demo и ModelScope Demo. В демонстрациях показаны возможности глубокого анализа длинных романов (например, трилогии «Задача трёх тел»), репозиторного ассистента по коду и чтения множества научных статей. В будущем команда планирует улучшить согласование с человеческими предпочтениями на длинных последовательностях, оптимизировать инференс и выпустить более крупные модели с длинным контекстом.
Источник: Alibaba Qwen —
оригинал
