ModèlesOpen Source 🇨🇳 28.07.2026 00:03

Alibaba dévoile la série Qwen3 Embedding pour le text embedding et le classement

Alibaba/QwenAlibaba/Qwen
Alibaba a présenté Qwen3 Embedding, une nouvelle famille de modèles propriétaires pour le text embedding, la recherche et le classement, construite sur la base de Qwen3. Les modèles atteignent une qualité de pointe sur les benchmarks, prennent en charge plus de 100 langues et sont publiés sous la licence Apache 2.0.
Alibaba a publié la série Qwen3 Embedding — de nouveaux modèles propriétaires de la famille Qwen, conçus pour l'incorporation de texte, la recherche et le classement. Les modèles sont basés sur le modèle fondateur Qwen3, qui leur confère des capacités multilingues. La série comprend trois tailles de modèles d'incorporation (0,6B, 4B, 8B) et trois modèles de classement (0,6B, 4B, 8B). Les modèles d'incorporation prennent en charge des dimensions vectorielles personnalisées (apprentissage de représentation Matryoshka, c'est-à-dire MRL) et des instructions. Les modèles sont open-source sous licence Apache 2.0 sur Hugging Face et ModelScope ; le rapport technique et le code sont publiés sur GitHub. L'architecture des modèles d'incorporation est à double encodeur, et celle des modèles de classement est à encodeur croisé. L'entraînement a été réalisé en plusieurs étapes : pour les modèles d'incorporation — pré-entraînement contrastif sur des données faiblement étiquetées, suivi d'un entraînement sur des données étiquetées de haute qualité et d'une fusion de modèles ; pour les modèles de classement — entraînement direct sur des données étiquetées. La capacité générative de Qwen3 a été utilisée pour générer des paires faiblement étiquetées pendant la phase de pré-entraînement. À l'avenir, Alibaba prévoit d'améliorer l'efficacité de l'entraînement et du déploiement, ainsi que d'étendre la famille aux représentations multimodales.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches