Alibaba veröffentlicht Qwen3 Embedding-Serie für Texteinbettung und Ranking
Alibaba/Qwen
Alibaba hat Qwen3 Embedding eingeführt, eine neue Familie proprietärer Modelle für Texteinbettung, Suche und Ranking, die auf der Qwen3-Grundlage aufbaut. Die Modelle erreichen Spitzenqualität in Benchmarks, unterstützen über 100 Sprachen und werden unter der Apache-2.0-Lizenz veröffentlicht.
Alibaba hat die Qwen3 Embedding-Serie veröffentlicht – neue proprietäre Modelle der Qwen-Familie, die für Text-Embedding, Suche und Ranking entwickelt wurden. Die Modelle basieren auf dem grundlegenden Qwen3-Modell, das ihnen mehrsprachige Fähigkeiten verleiht. Die Serie umfasst drei Größen von Embedding-Modellen (0,6B, 4B, 8B) und drei Ranking-Modelle (0,6B, 4B, 8B). Die Embedding-Modelle unterstützen benutzerdefinierte Vektordimensionen (Matryoshka Representation Learning, MRL) und Anweisungen. Die Modelle sind unter der Apache-2.0-Lizenz auf Hugging Face und ModelScope als Open Source veröffentlicht; der technische Bericht und der Code sind auf GitHub veröffentlicht. Die Architektur der Embedding-Modelle ist ein Dual-Encoder, die der Ranking-Modelle ein Cross-Encoder. Das Training erfolgte in mehreren Phasen: für die Embedding-Modelle – kontrastives Vortraining auf schwach gelabelten Daten, gefolgt von Training auf hochwertigen gelabelten Daten und Modellzusammenführung; für die Ranking-Modelle – direktes Training auf gelabelten Daten. Die generative Fähigkeit von Qwen3 wurde genutzt, um während der Vortrainingsphase schwach gelabelte Paare zu generieren. In Zukunft plant Alibaba, die Trainings- und Bereitstellungseffizienz zu verbessern sowie die Familie auf multimodale Repräsentationen zu erweitern.
Quelle: Alibaba Qwen —
Original
