Nghiên cứuRobot 🇨🇳 03.08.2026 14:01

200 Nhiệm Vụ, 17 Triệu Khung Hình: Robot Daxia Mở Nguồn Bộ Dữ Liệu Nhập Thể Cấp Độ L5 ACE-Data-0, Biến Ngôi Nhà Thực Tế Thành Sách Giáo Khoa Vật Lý Cho Robot

Robot Daxia, cùng với Phòng Thí Nghiệm S-Lab của Đại học Công nghệ Nanyang, đã mở nguồn bộ dữ liệu trí tuệ vật lý nhập thể đa phương thức cấp độ L5 có tên ACE-Data-0, bao gồm 17 triệu khung hình, 200 loại nhiệm vụ, 50 người tham gia và 2 bối cảnh nhà ở thực tế. Bộ dữ liệu này thu thập dữ liệu đa phương thức đồng bộ bao gồm video góc nhìn thứ nhất và thứ ba, chuyển động toàn thân và tay, quỹ đạo vật thể, âm thanh và tín hiệu xúc giác, tất cả được căn chỉnh theo một dòng thời gian chung và hệ tọa độ không gian. ACE-Data-0 nhằm mục đích cung cấp nền tảng dữ liệu chất lượng cao cho các mô hình nhập thể, hỗ trợ khả năng tổng quát hóa, phản ánh và tiến hóa hướng tới triển khai quy mô lớn trong thế giới thực.
Daxia Robot, hợp tác với S-Lab thuộc Đại học Công nghệ Nanyang (Nanyang Technological University), đã mã nguồn mở tập dữ liệu ACE-Data-0, một tập dữ liệu vật lý thông minh hiện thân (embodied physical intelligence) đa phương thức cấp độ L5. Được xây dựng dựa trên định luật mật độ thông tin đầu tiên trên thế giới dành cho các mô hình hiện thân (embodied models) và sơ đồ thu thập dữ liệu môi trường lấy con người làm trung tâm phiên bản 2.0, tập dữ liệu này khai thác động cơ thu thập môi trường ACE. ACE-Data-0 bao gồm 17 triệu khung hình video, 200 danh mục nhiệm vụ, 50 người tham gia, 2 cảnh nhà thực tế và 75.000 đoạn tương tác, bao quát các tương tác người-vật ở cấp độ nguyên tử (atomic-level), các chuỗi hoạt động sinh hoạt gia đình theo chuỗi dài hạn (long-horizon) và các tương tác giữa người với không gian sống. Dữ liệu được thu thập đồng thời từ video góc nhìn thứ nhất, video đa góc nhìn thứ ba, chuyển động toàn thân và tay, quỹ đạo sáu bậc tự do (six degrees of freedom, DOF) của vật thể, âm thanh đa kênh và tín hiệu xúc giác, tất cả đều được đồng bộ theo một mốc thời gian và hệ tọa độ không gian thống nhất. Tập dữ liệu sử dụng hai hệ thống thu thập bổ trợ cho nhau: một hệ thống quy mô mặt bàn dành cho các tương tác tay-vật thể chi tiết, và một hệ thống quy mô toàn phòng dành cho các hoạt động trong toàn bộ không gian, với cùng cơ chế hiệu chuẩn và đồng bộ hóa. Khác với phương pháp thu thập theo kịch bản định trước, ACE-Data-0 sử dụng các chỉ dẫn ở cấp độ mục tiêu, cho phép người tham gia tự do lựa chọn vật phẩm, trình tự thực hiện và đường đi, từ đó giữ lại được những biến thiên tự nhiên như sự do dự hay việc quay lại thao tác. Dựa trên tập dữ liệu này, Daxia đã xây dựng một bộ chuẩn đánh giá ba cấp độ cho nhận thức hiện thân, kiểm tra các mô hình về khả năng cảm nhận tiếp xúc, khôi phục trạng thái và hiểu tương tác tay-vật thể. Kết quả đánh giá trên hơn 30 phương pháp tiêu biểu cho thấy còn tồn tại những khoảng cách năng lực đáng kể trong các tình huống tiếp xúc, bị che khuất nghiêm trọng, tự chuyển động (egomotion), góc nhìn cực đoan và các nhiệm vụ có chuỗi dài hạn. Tập dữ liệu được thiết kế để hỗ trợ học bắt chước (imitation learning), các mô hình thế giới (world models), các mô hình VLA (vision-language-action), học chính sách cho robot (robot policy learning), cũng như việc chuyển giao từ các minh chứng của con người sang các dạng hiện thân robot khác nhau.
Nguồn: InfoQ 中国 — bản gốc
Bài viết liên quan trước đây ↓
Tin mới