Alibaba étend la longueur de contexte de Qwen2.5-Turbo à 1 million de tokens
Alibaba/Qwen
OpenAI
Alibaba publie Qwen2.5-Turbo avec une longueur de contexte étendue de 128 000 à un million de tokens. Le modèle atteint une précision de 100 % sur la tâche de récupération de clé à un million de tokens et obtient un score de 93,1 sur le benchmark RULER, surpassant ainsi GPT-4. La vitesse d'inférence est améliorée jusqu'à 4,3 fois grâce à une attention éparse, tandis que les coûts restent à 0,3 yuan par million de tokens.
Alibaba a annoncé le modèle Qwen2.5-Turbo, dont la longueur de contexte est étendue de 128 000 à 1 million de tokens, l'équivalent d'environ 1 million de mots anglais ou 1,5 million de caractères chinois. Le modèle atteint une précision de 100 % dans la tâche Passkey Retrieval sur 1 million de longueur et obtient un score de 93,1 sur le benchmark d'évaluation de textes longs RULER, surpassant les 91,6 de GPT-4 et les 89,9 de GLM4-9B-1M. Grâce à des mécanismes d'attention sparse, le temps jusqu'au premier token pour un contexte d'1 million de tokens est réduit de 4,9 minutes à 68 secondes, soit une accélération multipliée par 4,3. Le prix reste de 0,3 yuan par million de tokens, permettant à Qwen2.5-Turbo de traiter 3,6 fois plus de tokens que GPT-4o-mini pour le même coût. Le modèle conserve des performances compétitives sur les séquences courtes, au niveau de GPT-4o-mini. Il est disponible via l'API Alibaba Cloud Model Studio, la démo HuggingFace et la démo ModelScope.
Source: Alibaba Qwen —
original
