⚡ BREAKING
Qwen2.5 Omni: Ziet, Hoort, Spreekt, Schrijft – Alles in Één
Alibaba/Qwen
Alibaba Qwen heeft Qwen2.5-Omni uitgebracht, een vlaggenschip multimodaal model dat tekst, afbeeldingen, audio en video kan verwerken, en ook real-time spraak kan genereren. Het model maakt gebruik van de Thinker-Talker architectuur en overtreft vergelijkbare modellen in alle modaliteiten.
Alibaba Qwen heeft Qwen2.5-Omni onthuld, een nieuw vlaggenschipmodel in de Qwen-serie dat is ontworpen voor uitgebreide multimodale perceptie. Het model verwerkt tekst, afbeeldingen, audio en video, en genereert streaming reacties in de vorm van tekst of natuurlijke spraak. De Thinker-Talker-architectuur omvat een Thinker die invoer begrijpt en een Talker die spraak genereert. Het model is beschikbaar op Hugging Face, ModelScope, DashScope en GitHub. Qwen2.5-Omni presteert beter dan Qwen2.5-VL-7B en Qwen2-Audio bij audiotaken, is vergelijkbaar bij video en afbeeldingen, en behaalt state-of-the-art resultaten op OmniBench. Het model toont ook een hoge nauwkeurigheid bij spraakherkenning, vertaling, audiobegrip en spraakgeneratie. Toekomstplannen omvatten het verbeteren van de naleving van spraakopdrachten en het integreren van meer modaliteiten.
Bron: Alibaba Qwen —
origineel
