интегрироваться с устройствами для автоматических операций. Поддерживается многоязычность, включая европейские языки, японский, корейский, арабский, вьетнамский. Qwen2-VL использует Vision Transformer с 600 миллионами параметров и поддерживает динамическое разрешение. Введена мультимодальная позиционная эмбеддинг M-ROPE для одновременного захвата текстовой, визуальной и видеоинформации. Модель демонстрирует превосходство в понимании документов и решении задач, превосходя GPT-4o и Claude 3.5-Sonnet. Ограничения модели: отсутствие извлечения аудио из видео, знания до июня 2023 года, трудности в подсчёте и распознавании символов.