ForschungModelle 🇨🇳 13.08.2026 20:02

HiDream.ai-Algorithmuswissenschaftler Dr. Pan Yingwei spricht auf der AICon Shenzhen über den Weg von der Token-Vorhersage zur Zustandsvorhersage: hin zu nativen multimodalen Weltmodellen

Der Algorithmuswissenschaftler Dr. Pan Yingwei von HiDream.ai wird auf der AICon Shenzhen (21.-22. August) einen Vortrag über den Übergang von der Token-Vorhersage zur Zustandsvorhersage in Weltmodellen halten. Der Vortrag behandelt die von HiDream selbst entwickelte native multimodale UiT-Architektur, die Bilder, Text, Video, 3D und Aktionssignale in einem gemeinsamen Darstellungsraum vereint. Weitere Vorträge beschäftigen sich mit verkörperter KI, Performance-Engineering und physischer KI.
Die nächste Phase des KI-Wettbewerbs verschiebt sich von Modellfähigkeiten hin zum Aufbau zuverlässiger Agenten, zur Verbesserung von KI-Engineering-Systemen und zur Gewährleistung eines stabilen Betriebs in komplexen Umgebungen. Auf der AICon Global AI Development and Application Conference in Shenzhen vom 21. bis 22. August wird Dr. Pan Yingwei, Algorithmus-Wissenschaftler bei HiDream.ai, eine Keynote mit dem Titel 'Von der Token-Prädiktion zur Zustandsprädiktion: Der native multimodale Pfad zu Weltmodellen' halten. Er wird argumentieren, dass sich der Fokus der KI von großen Sprachmodellen hin zu Weltmodellen verlagert, wobei sich das Ziel von der Vorhersage des nächsten Tokens zur Vorhersage des nächsten Zustands verschiebt und eine Neukonstruktion der Performance-Engineering-Paradigmen erfordert. Traditionelle multimodale Modelle sind im Wesentlichen 'single-modale Verkettungen', die bei jeder Übertragung zwischen Modulen Informationen verlieren und es nicht schaffen, ein einheitliches Verständnis des physikalischen Weltzustands aufzubauen. HiDream hat mit seiner selbst entwickelten UiT-Architektur einen alternativen Weg eingeschlagen, der rohe Signale wie Bildpixel, Text-Tokens, Video, 3D und Aktionen in einem gemeinsamen Repräsentationsraum vereint, mit einheitlicher Tokenisierung und End-to-End-Verarbeitung in einem einzigen Netzwerk. Der Vortrag wird Einblicke in Modelldesign, Trainingsparadigmen und Inferenzarchitekturen geben und die entscheidenden Variablen für die Entwicklung von nativen multimodalen zu Weltmodellen untersuchen. Weitere Keynotes werden von Experten wie Dr. Wu Zheming, Mitgründer und Geschäftsführer von Qunqing Intelligent; Dr. Zhou Jingsen von der Zhejiang-Universität; Tao Jianhui, Gründer und Geschäftsführer von TDengine; und Dr. Wang Chenglu, Geschäftsführer von Shen Kaihong, gehalten, die Themen wie industrielle verkörperte Intelligenz und physische KI abdecken.
Quelle: InfoQ 中国 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten