ModelleOpen Source 🇨🇳 28.07.2026 16:03

Alibaba veröffentlicht Qwen2.5-VL: Neue multimodale Flaggschiff-Modell

Alibaba/QwenAlibaba/Qwen
Alibaba hat Qwen2.5-VL vorgestellt, eine neue Generation von Vision-Language-Modellen, die in den Größen 3B, 7B und 72B verfügbar ist. Das Modell zeichnet sich durch verbessertes visuelles Verständnis, Unterstützung für über eine Stunde lange Videos, Fähigkeit zu agentischen Aktionen und strukturierte Ausgabe aus.
Die Gruppe Qwen von Alibaba hat Qwen2.5-VL veröffentlicht – ein neues Flaggschiff-Modell für Vision und Sprache. Es ist in drei Größen verfügbar: 3B, 7B und 72B, sowohl als Base- also auch als Instruct-Version, auf Hugging Face und ModelScope. Das Modell kann Objekte, Texte, Diagramme erkennen und auch als visueller Agent fungieren: Es kann einen Computer oder ein Telefon steuern. Es versteht Videos mit einer Länge von über einer Stunde und kann Ereignisse zeitlich lokalisieren. Das Modell unterstützt die präzise Lokalisierung von Objekten mittels Begrenzungsrahmen und Schlüsselpunkten sowie strukturierte JSON-Ausgaben für Dokumente, Rechnungen und Tabellen. Das Flaggschiff Qwen2.5-VL-72B-Instruct zeigt wettbewerbsfähige Ergebnisse in Benchmarks, darunter Aufgaben auf College-Niveau, Mathematik, Dokumentenverständnis und Videos. Die kleineren Versionen (7B) übertreffen GPT-4o-mini in einer Reihe von Aufgaben, und die für Edge-KI konzipierte 3B-Version übertrifft das vorherige 7B-Modell. Auch die Bilderkennung wurde verbessert: Das Modell deckt nun eine große Anzahl von Kategorien ab, darunter Pflanzen, Tiere, Sehenswürdigkeiten, Filmcharaktere und Waren. Das Modell verwendet das HTML-Format für die Dokumentenauszeichnung (QwenVL HTML).
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten