ModelleOpen Source 🇨🇳 28.07.2026 18:03

Alibaba veröffentlicht Qwen2.5-Coder: Bis zu 32B Parameter, Open-Source-Code-Modelle

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek MistralMistral
Das Qwen-Team von Alibaba kündigt Qwen2.5-Coder an, eine Open-Source-Code-Modellreihe der nächsten Generation in den Größen 1,5B, 7B und demnächst 32B, die mit 5,5 Billionen Token trainiert wurde. Die 7B-Version übertrifft größere Modelle wie DeepSeek-Coder-V2-Lite und CodeStral-22B bei Code-Aufgaben, behält aber auch starke mathematische und allgemeine Fähigkeiten.
Das Qwen-Team von Alibaba hat Qwen2.5-Coder veröffentlicht, den Nachfolger von CodeQwen1.5, als Teil der Qwen2.5-Serie. Die Modelle sind in drei Größen erhältlich: 1,5B, 7B und eine 32B-Version, die bald erscheint. Sie wurden mit 5,5 Billionen Token trainiert, darunter Quellcode, Text-Code-Bezugsdaten und synthetische Daten, ergänzt durch Mathematik- und allgemeine Daten, um die nicht-codebezogenen Fähigkeiten zu erhalten. Das Basismodell unterstützt bis zu 128.000 Token Kontext, 92 Programmiersprachen und erzielt Spitzenwerte bei der Codegenerierung, -vervollständigung, -reparatur und bei mehrsprachigen Benchmarks. Die 7B-Version übertrifft DeepSeek-Coder-V2-Lite und CodeStral-22B bei Codeaufgaben und zeigt auch wettbewerbsfähige Mathematikleistungen bei GSM8K und Math-Bewertungen. Die anweisungsoptimierte Variante Qwen2.5-Coder-Instruct verbessert die Aufgabenerfüllung und Generalisierung weiter und zeichnet sich durch mehrsprachiges Code-Reasoning (McEval), Code-Reasoning (CRUXEval) und Mathematik-Reasoning (GSM8K, OlympiadBench) aus. Sie behält zudem starke allgemeine Fähigkeiten bei MMLU, CEval und anderen Benchmarks. Die Modelle werden unter der Apache-2.0-Lizenz veröffentlicht. Nächste Schritte umfassen eine 32B-Version und die Erforschung codezentrierter Reasoning-Modelle.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten