Tiến sĩ Phan Anh Vỹ, nhà khoa học thuật toán của HiDream.ai, sẽ phát biểu tại AICon Thâm Quyến về hành trình từ dự đoán token đến dự đoán trạng thái: hướng tới mô hình thế giới đa phương thức bản địa
Tiến sĩ Phan Anh Vỹ, nhà khoa học thuật toán của HiDream.ai, sẽ có bài phát biểu chính tại AICon Thâm Quyến (21-22/8) về việc chuyển từ dự đoán token sang dự đoán trạng thái trong mô hình thế giới. Bài nói sẽ đề cập đến kiến trúc đa phương thức bản địa UiT do HiDream tự phát triển, thống nhất hình ảnh, văn bản, video, 3D và tín hiệu hành động vào một không gian biểu diễn chung. Các bài phát biểu chính khác sẽ đề cập đến AI nhúng, kỹ thuật hiệu suất và AI vật lý.
Giai đoạn tiếp theo của cuộc cạnh tranh trong lĩnh vực trí tuệ nhân tạo (AI) đang dịch chuyển vượt ra ngoài năng lực của mô hình, hướng tới việc xây dựng các tác tử đáng tin cậy, hoàn thiện các hệ thống kỹ thuật AI và đảm bảo vận hành ổn định trong những môi trường phức tạp. Tại Hội nghị Phát triển và Ứng dụng AI Toàn cầu AICon (AICon Global AI Development and Application Conference) diễn ra ở Thâm Quyến trong hai ngày 21–22/8, Tiến sĩ Pan Yingwei, nhà khoa học thuật toán của HiDream.ai, sẽ có bài phát biểu chính với tựa đề 'Từ dự đoán token đến dự đoán trạng thái: Con đường đa phương thức bản địa hướng tới các mô hình thế giới' (From Token Prediction to State Prediction: The Native Multimodal Path to World Models). Ông sẽ lập luận rằng trọng tâm của AI đang chuyển từ các mô hình ngôn ngữ lớn sang các mô hình thế giới, nơi mục tiêu từ việc dự đoán token tiếp theo trở thành dự đoán trạng thái tiếp theo, đòi hỏi phải tái cấu trúc các mô thức kỹ thuật hiệu năng. Các mô hình đa phương thức truyền thống về bản chất chỉ là những 'phép ghép nối đơn phương thức', khiến thông tin bị thất thoát ở mỗi lần chuyển giao giữa các mô-đun, và do đó không thể hình thành một sự hiểu biết thống nhất về trạng thái của thế giới vật lý. HiDream đã đi theo một con đường khác với kiến trúc UiT do hãng tự phát triển, trong đó các tín hiệu thô như điểm ảnh (pixel), token văn bản, video, dữ liệu ba chiều (3D) và hành động được đưa về một không gian biểu diễn chung, với quy trình token hóa thống nhất và xử lý đầu-cuối trong một mạng duy nhất. Bài phát biểu sẽ chia sẻ những kinh nghiệm và hiểu biết sâu sắc về thiết kế mô hình, các mô thức huấn luyện và kiến trúc suy luận, đồng thứng tìm hiểu các biến số quyết định để tiến hóa từ đa phương thức bản địa lên mô hình thế giới. Các bài phát biểu chính khác sẽ được trình bày bởi những chuyên gia như Tiến sĩ Wu Zheming, đồng sáng lập kiêm giám đốc điều hành (CEO) của Qunqing Intelligent; Tiến sĩ Zhou Jingsen thuộc Đại học Chiết Giang; ông Tao Jianhui, nhà sáng lập kiêm CEO của TDengine; và Tiến sĩ Wang Chenglu, CEO của Shen Kaihong, bao gồm các chủ đề như trí tuệ hiện thân trong công nghiệp và AI vật lý.
Nguồn: InfoQ 中国 —
bản gốc
