архитектуры. Для решения задачи унификации модальностей команда разработала механизм multi-router (мультимаршрутизации), отвечающий за маршрутизацию к экспертам, специализированным под конкретные модальности, а также AnyExperts — механизм, динамически распределяющий задачи между экспертами на основе значимости токенов, что снижает избыточность токенов изображений и видео. Кроме того, была внедрена стратегия совместного обучения с планированием соотношения данных и динамической регулировкой скорости обучения (learning rate) в зависимости от скорости сходимости модели. Для унификации задач команда взяла за основу замороженный (frozen) мультимодальный backbone для понимания контента, добавив к нему возможности генерации изображений и синтеза речи. Это было дополнено детализированными визуальными знаниями за счёт обучения генеративной сегментации, двухпотоковым подходом к передаче информации для сохранения идентичности объектов, а также раздельным извлечением типографических признаков во избежание искажения текста. Возможности генерации речи были расширены за счёт управления диалектом, эмоциональной окраской и настраиваемым тембром голоса, а также одновременной генерации речи, звуковых эффектов и музыки. Модель достигла результатов уровня state-of-the-art (лучших в своём классе) по всем модальностям, сравнявшись со специализированными моделями или превзойдя их, и стала первой открытой (open-source) унифицированной моделью с полным охватом модальностей, насчитывающей триллион параметров. Инженерные оптимизации включали схему полномодальной упаковки последовательностей (sequence packing) и гибкие стратегии параллелизации, что повысило эффективность обучения на 67%.

Показать ещё ↓