ModelleForschung 🇨🇳 28.07.2026 00:03

Alibaba Qwen veröffentlicht QVQ-Max: Visuelles Reasoning-Modell mit Belegen

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen hat offiziell QVQ-Max veröffentlicht, die erste Version seines visuellen Reasoning-Modells. Es kann nicht nur Bilder und Videos erkennen, sondern auch analysieren und Aufgaben von Mathematik bis Kreativität lösen. Die Entwickler stellten fest, dass die Genauigkeit des Modells auf dem MathVision-Benchmark mit der Länge des Denkprozesses zunimmt.
Alibaba Qwen hat QVQ-Max vorgestellt, die erste Version eines visuellen Denkmodells, das über den im Dezember veröffentlichten Vorgänger QVQ-72B-Preview hinausgeht. Das Modell versteht den Inhalt von Bildern und Videos, analysiert und schlussfolgert auf deren Grundlage und hilft bei der Lösung von Aufgaben – von mathematischen Problemen bis hin zu alltäglichen Fragen und kreativen Tätigkeiten. Im Benchmark MathVision, der komplexe multimodale Mathematikaufgaben aggregiert, steigt die Genauigkeit des Modells mit zunehmender maximaler Länge des Denkprozesses. QVQ-Max verfügt über drei Schlüsselfähigkeiten: detaillierte Beobachtung (Erkennung von Objekten, Text und kleinen Details), tiefgehendes Denken (Schlussfolgerungen auf Basis visueller Informationen und Hintergrundwissen) sowie flexible Anwendung (von Problemlösung bis zur Erstellung von Illustrationen und Szenarien). Zu den Demonstrationsbeispielen gehören Hilfe bei der Arbeit (Datenanalyse, Code-Schreiben), beim Lernen (Lösen von Aufgaben mit Diagrammen) und im Alltag (Empfehlungen für Kleidung und Rezepte). Zukünftige Pläne umfassen die Verbesserung der Erkennungsgenauigkeit durch Verifikationsmechanismen, die Entwicklung eines visuellen Agenten für mehrschrittige Aufgaben (Steuerung von Smartphone oder Computer) sowie die Verbesserung der Interaktion durch Hinzufügen von Werkzeugen und visueller Generierung.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten