Qwen2.5 Omni: видит, слышит, говорит, пишет — всё в одном
Alibaba/Qwen
Alibaba Qwen представила Qwen2.5-Omni — новую флагманскую мультимодальную модель, способную обрабатывать текст, изображения, аудио и видео, а также генерировать ответы в виде текста и естественной речи в реальном времени. Модель с архитектурой Thinker-Talker доступна в открытых источниках и демонстрирует высокую производительность во всех модальностях.
Alibaba Qwen выпустила Qwen2.5-Omni — энд-ту-энд мультимодальную модель, которая воспринимает текст, изображения, аудио и видео и одновременно генерирует текст и естественную речь в потоковом режиме. В основе модели лежит новая архитектура Thinker-Talker, где Thinker (аналог мозга) обрабатывает входные данные разных модальностей и создаёт высокоуровневые представления, а Talker (аналог рта) на их
Показать ещё ↓
- Сокращения
- TMRoPE = Time-aligned Multimodal Rotary Position Embedding — временное мультимодальное роторное позиционное встраивание
Источник: Alibaba Qwen —
оригинал
