Mô hìnhMã nguồn mở 🇷🇺 04.08.2026 11:03

Kandinsky WM 1.0: Các Mô Hình Sinh Cho Trí Tuệ Nhân Tạo Vật Lý

СберСбер NVIDIANVIDIA MetaMeta
Sber đã phát hành Kandinsky WM 1.0, một bộ gồm ba mô hình chuyển đổi hình ảnh thành video, được thiết kế cho xe tự hành, robot và các cảnh vật lý phức tạp. Các mô hình này, dựa trên Kandinsky 5.0 Video Lite, được cung cấp theo giấy phép MIT và nhằm giải quyết tình trạng thiếu dữ liệu trong Trí Tuệ Nhân Tạo Vật Lý bằng cách tạo ra các video tổng hợp chính xác về mặt vật lý.
Sber đã mã nguồn mở Kandinsky WM 1.0, một bộ ba mô hình tạo video chuyên dụng cho Physical AI: K5-AV dành cho xe tự hành, K5-RO dành cho robot và K5-PH dành cho các cảnh có vật lý phức tạp. Các mô hình này dựa trên Kandinsky 5.0 Video Lite với 2 tỷ tham số và hoạt động ở chế độ ảnh-video (image-to-video), nhận khung hình đầu tiên và một lời nhắc văn bản để tạo ra phần tiếp theo. Mỗi mô hình được điều chỉnh theo từng miền (domain-adapted) trên các tập dữ liệu cụ thể: 1,5 triệu video từ NVIDIA PhysicalAI Autonomous Vehicles, 2,2 triệu video robot từ nhiều nguồn khác nhau bao gồm GenRobot 10Kh RealOmni và AgiBot World Beta, và 1,6 triệu video vật lý với 1,3 triệu từ tiền huấn luyện và 300 nghìn được chọn lọc thủ công. Sau khi điều chỉnh theo miền, các mô hình trải qua giai đoạn huấn luyện thứ hai: học tăng cường (RL - Reinforcement Learning) với mô hình phần thưởng cho K5-AV và K5-RO, và SOAR cho K5-PH. Bản phát hành bao gồm mã nguồn và trọng số theo giấy phép MIT. Bài báo cũng nêu bật vấn đề dữ liệu đuôi dài (long-tail) trong Physical AI, nơi các tình huống hiếm gặp rất quan trọng nhưng khó thu thập, đồng thời lưu ý rằng các mô hình tạo video hiện tại thường thiếu độ chính xác vật lý, đòi hỏi phải huấn luyện và huấn luyện sau (post-training) chuyên biệt theo từng miền.
Nguồn: Habr — хаб ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới