Open SourceModelle 🇨🇳 28.07.2026 16:03

Alibaba veröffentlicht Quellcode von Qwen2.5-1M mit Unterstützung für Kontexte von bis zu 1 Million Token

Alibaba/QwenAlibaba/Qwen
Alibaba hat die offenen Modelle Qwen2.5-7B-Instruct-1M und Qwen2.5-14B-Instruct-1M mit einem Kontext von bis zu 1 Million Token sowie ein optimiertes Inferenz-Framework auf Basis von vLLM veröffentlicht. Die Modelle übertreffen frühere Versionen und GPT-4o-mini bei Aufgaben mit langem Kontext, während sie die Leistung bei kurzen Texten beibehalten.
Alibaba Qwen hat die offenen Modelle Qwen2.5-7B-Instruct-1M und Qwen2.5-14B-Instruct-1M vorgestellt, die einen Kontext von bis zu einer Million Token verarbeiten können. Für deren Bereitstellung hat das Unternehmen das Inferenz-Framework basierend auf vLLM vollständig geöffnet, das sparse Attention nutzt und die Verarbeitung von einer Million Token um das Drei- bis Siebenfache beschleunigt. Die Modelle wurden progressiv trainiert: zunächst auf Sequenzen von bis zu 256.000 Token und dann mithilfe von Längenextrapolation (Dual Chunk Attention) auf eine Million Token erweitert. In Tests zur Passkey-Extraktion und bei komplexen Aufgaben (RULER, LV-Eval, LongBench) übertrafen die Modelle die Versionen mit 128K und GPT-4o-mini deutlich. Für die Inferenz wird eine GPU mit Ampere- oder Hopper-Architektur empfohlen, mindestens 120 GB VRAM für 7B und 320 GB für 14B. Zudem wurde Qwen Chat vorgestellt, ein KI-Assistent mit Unterstützung für lange Kontexte.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten