алгоритмов компании HiDream.ai, выступит с пленарным докладом «От предсказания токенов к предсказанию состояний: нативный мультимодальный путь к мировым моделям». Он будет утверждать, что центр внимания в ИИ смещается от больших языковых моделей к мировым моделям, где цель меняется с предсказания следующего токена на предсказание следующего состояния, — а это требует пересмотра парадигм инженерии производительности. Традиционные мультимодальные модели по сути представляют собой «склейки одномодальных компонентов»: при каждой передаче данных между модулями теряется информация, поэтому они не способны сформировать единое понимание состояния физического мира. HiDream пошла альтернативным путём, создав собственную архитектуру UiT, которая объединяет необработанные сигналы — пиксели изображений, текстовые токены, видео, 3D-данные и действия — в едином пространстве представлений за счёт унифицированной токенизации и сквозной (end-to-end) обработки в одной сети. В докладе будут представлены наработки в области проектирования моделей, парадигм обучения и архитектур инференса, а также рассмотрены определяющие факторы перехода от нативной мультимодальности к мировым моделям. С другими пленарными докладами выступят такие эксперты, как доктор У Чжэмин, сооснователь и генеральный директор (Chief Executive Officer, CEO) компании Qunqing Intelligent; доктор Чжоу Цзинсэнь из Чжэцзянского университета; Тао Цзяньхуэй, основатель и генеральный директор TDengine; и доктор Ван Чэнлу, генеральный директор Shen Kaihong, — среди затрагиваемых тем, в частности, промышленный воплощённый интеллект и физический ИИ.