⚡ EN DIRECT
Qwen2.5 Omni : voit, entend, parle, écrit – tout-en-un
Alibaba/Qwen
Alibaba Qwen a publié Qwen2.5-Omni, un modèle multimodal phare capable de traiter le texte, les images, l'audio et la vidéo, ainsi que de générer de la parole en temps réel. Le modèle utilise l'architecture Thinker-Talker et surpasse des modèles similaires dans toutes les modalités.
Alibaba Qwen a dévoilé Qwen2.5-Omni, un nouveau modèle phare de la série Qwen conçu pour la perception multimodale complète. Le modèle traite le texte, les images, l'audio et la vidéo, générant des réponses en streaming sous forme de texte ou de parole naturelle. L'architecture Thinker-Talker comprend un Thinker qui comprend les entrées et un Talker qui génère la parole. Le modèle est disponible sur Hugging Face, ModelScope, DashScope et GitHub. Qwen2.5-Omni surpasse Qwen2.5-VL-7B et Qwen2-Audio sur les tâches audio, est comparable sur vidéo et images, et atteint des résultats de pointe sur OmniBench. Le modèle démontre également une haute précision en reconnaissance vocale, traduction, compréhension audio et génération de parole. Les projets futurs incluent l'amélioration du respect des commandes vocales et l'intégration de modalités supplémentaires.
Source: Alibaba Qwen —
original
