⚡ 速報
モデルメディア生成 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni:見て、聞いて、話して、書く——すべてを1つに

Alibaba/QwenAlibaba/Qwen
Alibaba Qwenは、テキスト、画像、音声、動画を処理し、リアルタイムの音声生成も可能な旗艦マルチモーダルモデルQwen2.5-Omniをリリースしました。このモデルはThinker-Talkerアーキテクチャを採用し、すべてのモダリティにおいて類似モデルを凌駕しています。
阿里巴巴的Qwen发布了Qwen2.5-Omni,这是Qwen系列中一款面向全面多模态感知的新旗舰模型。该模型能够处理文本、图像、音频和视频,并以文本或自然语音的形式生成流式响应。其Thinker-Talker架构包含一个负责理解输入的Thinker和一个生成语音的Talker。该模型已在Hugging Face、ModelScope、DashScope和GitHub上开放。Qwen2.5-Omni在音频任务上优于Qwen2.5-VL-7B和Qwen2-Audio,在视频和图像方面表现相当,并在OmniBench上达到了最先进水平。该模型在语音识别、翻译、音频理解和语音生成方面也展现出高精度。未来计划包括改进对语音指令的遵循能力以及集成更多模态。
出典: Alibaba Qwen — 原文
関連記事 ↓
新着ニュース