RechercheModèles 🇨🇳 13.08.2026 20:02

Le scientifique en algorithme de HiDream.ai, le Dr Pan Yingwei, interviendra à l'AICon de Shenzhen sur le passage de la prédiction de jetons à la prédiction d'états : vers des modèles du monde multimodaux natifs

Le Dr Pan Yingwei, scientifique en algorithme chez HiDream.ai, prononcera un discours principal à l'AICon de Shenzhen (21-22 août) sur le passage de la prédiction de jetons à la prédiction d'états dans les modèles du monde. L'intervention couvrira l'architecture multimodale native UiT développée en interne par HiDream, qui unifie les images, le texte, la vidéo, la 3D et les signaux d'action dans un espace de représentation partagé. D'autres discours principaux aborderont l'IA incarnée, l'ingénierie de la performance et l'IA physique.
La prochaine phase de la compétition en IA dépasse les capacités des modèles pour se tourner vers la construction d'agents fiables, l'amélioration des systèmes d'ingénierie IA et la garantie d'un fonctionnement stable dans des environnements complexes. Lors de la conférence AICon sur le développement et les applications de l'IA mondiale à Shenzhen, les 21 et 22 août, le docteur Pan Yingwei, scientifique en algorithmes chez HiDream.ai, prononcera un discours principal intitulé « De la prédiction de jetons à la prédiction d'états : la voie multimodale native vers les modèles du monde ». Il soutiendra que l'attention de l'IA se déplace des grands modèles de langage vers les modèles du monde, où l'objectif passe de la prédiction du prochain jeton à la prédiction du prochain état, ce qui nécessite une refonte des paradigmes d'ingénierie de performance. Les modèles multimodaux traditionnels sont essentiellement des « concaténations unimodales » qui perdent de l'information à chaque transfert entre modules, ne parvenant pas à construire une compréhension unifiée de l'état du monde physique. HiDream a adopté une voie alternative avec son architecture UiT développée en interne, qui unifie les signaux bruts tels que les pixels d'image, les jetons de texte, la vidéo, la 3D et les actions dans un espace de représentation partagé, avec une tokenisation unifiée et un traitement de bout en bout dans un réseau unique. Le discours partagera des idées sur la conception des modèles, les paradigmes d'entraînement et les architectures d'inférence, et explorera les variables décisives pour passer des modèles multimodaux natifs aux modèles du monde. D'autres discours principaux seront donnés par des experts tels que le docteur Wu Zheming, cofondateur et directeur général de Qunqing Intelligent ; le docteur Zhou Jingsen de l'université du Zhejiang ; Tao Jianhui, fondateur et directeur général de TDengine ; et le docteur Wang Chenglu, directeur général de Shen Kaihong, couvrant des sujets comme l'intelligence incarnée industrielle et l'IA physique.
Source: InfoQ 中国 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches