Open SourceModellen 🇨🇳 28.07.2026 16:03

Alibaba brengt Qwen2.5-1M met ondersteuning voor context tot 1 miljoen tokens uit als open source

Alibaba/QwenAlibaba/Qwen
Alibaba heeft de open-source modellen Qwen2.5-7B-Instruct-1M en Qwen2.5-14B-Instruct-1M uitgebracht met een context van maximaal 1 miljoen tokens, samen met een geoptimaliseerd inferentieframework op basis van vLLM. De modellen presteren beter dan eerdere versies en GPT-4o-mini bij taken met lange context, terwijl de prestaties bij korte teksten behouden blijven.
Alibaba Qwen heeft de open modellen Qwen2.5-7B-Instruct-1M en Qwen2.5-14B-Instruct-1M gepresenteerd, die een context van maximaal 1 miljoen tokens kunnen verwerken. Voor de implementatie ervan heeft het bedrijf het inferentieframework op basis van vLLM volledig openbaar gemaakt, dat gebruikmaakt van sparse attention en de verwerking van 1M tokens 3 tot 7 keer versnelt. De modellen zijn progressief getraind: eerst op sequenties van maximaal 256K tokens en vervolgens via lengte-extrapolatie (Dual Chunk Attention) uitgebreid tot 1M. In tests voor wachtwoordherkenning (Passkey Retrieval) en complexe taken (RULER, LV-Eval, LongBench) presteerden de modellen aanzienlijk beter dan de versies met 128K en GPT-4o-mini. Voor inferentie wordt een GPU met Ampere- of Hopper-architectuur aanbevolen, met ten minste 120 GB VRAM voor 7B en 320 GB voor 14B. Ook is Qwen Chat geïntroduceerd, een AI-assistent met ondersteuning voor lange context.
Bron: Alibaba Qwen — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws