⚡ 突发新闻
模型媒体生成 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni:全能模型,看、听、说、写一应俱全

Alibaba/QwenAlibaba/Qwen
阿里巴巴通义千问团队发布了Qwen2.5-Omni,这是一款旗舰级多模态模型,能够处理文本、图像、音频和视频,并实时生成语音。该模型采用Thinker-Talker架构,在所有模态上均超越了同类模型。
阿里巴巴通义千问发布了Qwen2.5-Omni,这是Qwen系列的新旗舰模型,专为全面多模态感知设计。该模型处理文本、图像、音频和视频,以文本或自然语音形式生成流式响应。Thinker-Talker架构包含一个理解输入的Thinker和一个生成语音的Talker。该模型可在Hugging Face、ModelScope、DashScope和GitHub上获取。Qwen2.5-Omni在音频任务上超越了Qwen2.5-VL-7B和Qwen2-Audio,在视频和图像上表现相当,并在OmniBench上达到了最先进的结果。该模型在语音识别、翻译、音频理解和语音生成方面也表现出高精度。未来计划包括改进对语音命令的遵循能力并整合更多模态。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻