Qwen2.5 Omni : voir, entendre, parler, écrire — le tout-en-un
Alibaba Qwen a publié Qwen2.5-Omni, un nouveau modèle multimodal phare capable de traiter du texte, des images, de l'audio et de la vidéo, ainsi que de générer des réponses en texte et en parole naturelle en temps réel. Le modèle, construit sur une architecture Thinker-Talker, est open source et démontre des performances élevées dans toutes les modalités.
Alibaba/Qwen
