Alibaba veröffentlicht Qwen3.8-Max: Ein MoE-Modell mit 2,4 Billionen Parametern und das leistungsfähigste der Qwen-Familie
Alibaba/Qwen
OpenAI
Anthropic
Das Qwen-Team von Alibaba hat Qwen3.8-Max allgemein verfügbar gemacht, die offenen Gewichte werden nächste Woche versprochen. Das Mixture-of-Experts-Modell mit 2,4 Billionen Parametern unterstützt Text-, Bild- und Videoeingaben und übertrifft seinen Vorgänger bei multimodalen und agentischen Aufgaben.
Das Qwen-Team von Alibaba hat Qwen3.8-Max allgemein verfügbar gemacht und bestätigt, dass die offenen Gewichte nächste Woche zusammen mit einem zweiten Checkpoint, Qwen3.8-27B, ausgeliefert werden. Qwen3.8-Max ist ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, das Text-, Bild- und Videoeingaben akzeptiert und Text ausgibt. Die gehostete API ist für Unternehmen jeder Größe einsetzbar und kompatibel mit OpenAI und DashScope, während die offenen Gewichte ein Artefakt für Rechenzentren mit mehreren Knoten sind. Alibaba hat die Anzahl der aktivierten Parameter nicht offengelegt, was die Bereitstellungskosten unbekannt macht. Qwen3.8-27B ist der Checkpoint, der auf gewöhnliche lokale GPU-Hardware passt. Die veröffentlichte Funktionsliste deckt vier Branchen ab: Softwareentwicklung, Rechts- und Finanzdokumentprüfung, Medien- und E-Commerce-Betrieb sowie Design. Die Modellseite listet einen Kontextfenster von 1 Million Token auf, mit maximalem Eingang von 991.000 Token (983.000 mit aktiviertem Denken) und maximalem Ausgang von 131.000 Token. Die Preisgestaltung beträgt 2,00 US-Dollar pro 1 Million Eingabe-Token und 6,00 US-Dollar pro 1 Million Ausgabe-Token, wobei zwischengespeicherte Eingaben 0,25 US-Dollar pro 1 Million Token kosten. Unterstützte Funktionen umfassen Funktionsaufrufe, strukturierte Ausgaben, Stapelverarbeitung, Präfixvervollständigung und Feinabstimmung sowie fünf integrierte Tools auf der Responses-API. In Benchmarks erreicht Qwen3.8-Max 86,6 auf Terminal-Bench 2.1, hinter GPT-5.6 Sol (max) mit 88,8, aber vor Claude Opus 4.8 und Claude Fable 5 mit 84,6. Es führt bei PaperBench und IFBench und zeigt Verbesserungen bei multimodalen und agentischen Aufgaben im Vergleich zu seinem Vorgänger, obwohl die multimodalen Benchmarks gegen Qwen3.7-Plus und nicht gegen Qwen3.7-Max durchgeführt wurden. Die Verstärkungslernkurve des Modells erreicht ihren Höhepunkt bei 0,725 in der Nähe von 4.000 Trainingsumgebungen und fällt dann ab.
Quelle: MarkTechPost —
Original
