Open SourceModèles 🇨🇳 28.07.2026 16:03

Alibaba publie en open source Qwen2.5-1M avec un contexte allant jusqu'à 1 million de tokens

Alibaba/QwenAlibaba/Qwen
Alibaba a publié les modèles open source Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M avec un contexte allant jusqu'à 1 million de tokens, ainsi qu'un framework d'inférence optimisé basé sur vLLM. Les modèles surpassent les versions précédentes et GPT-4o-mini dans les tâches à long contexte, tout en maintenant leurs performances sur les textes courts.
Alibaba Qwen a dévoilé les modèles open source Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M, capables de traiter un contexte allant jusqu'à un million de jetons. Pour leur déploiement, l'entreprise a entièrement ouvert le framework d'inférence basé sur vLLM, qui utilise l'attention sparse (sparse attention) et accélère le traitement des 1 million de jetons de 3 à 7 fois. Les modèles ont été entraînés de manière progressive : d'abord sur des séquences allant jusqu'à 256 000 jetons, puis étendus à 1 million grâce à l'extrapolation de longueur avec Dual Chunk Attention. Lors des tests de récupération de mot de passe (Passkey Retrieval) et de tâches complexes (RULER, LV-Eval, LongBench), les modèles ont largement surpassé les versions à 128 000 jetons ainsi que GPT-4o-mini. Pour l'inférence, il est recommandé d'utiliser des GPU d'architecture Ampere ou Hopper, avec au moins 120 Go de mémoire vidéo VRAM pour le modèle 7B et 320 Go pour le 14B. L'assistant IA Qwen Chat, doté d'une prise en charge du long contexte, a également été présenté.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches