Mô hìnhRobot 🇺🇸 30.07.2026 18:01

Gemini Robotics ER 2: Trai nghiệm thị giác video, điều phối tác vụ và cộng tác đa robot

Google/DeepMindGoogle/DeepMind Boston DynamicsBoston Dynamics
Google DeepMind đã ra mắt Gemini Robotics ER 2, một mô hình lý luận thể hóa mới cho robot. Nó hỗ trợ hiểu video thời gian thực, lập kế hoạch tác vụ đa bước và cộng tác đa robot, hiện có sẵn qua Gemini API và Google AI Studio.
Google DeepMind giới thiệu Gemini Robotics ER 2, một mô hình suy luận nhúng cho robot, đóng vai trò như bộ não cấp cao cho robot. Nó có thể trò chuyện với con người, hiểu thế giới vật lý, lập kế hoạch cho các nhiệm vụ đa bước, và chuyển giao việc thực thi vận động cho các mô hình thị giác-ngôn ngữ-hành động (VLA) cấp thấp hơn. Mô hình này gọi một cách tự nhiên các công cụ như Google Search hoặc các hàm do người dùng định nghĩa. Nó cải thiện so với ER 1.6 bằng cách xử lý các luồng video liên tục để theo dõi tiến độ, thích ứng với thất bại và xác định hoàn thành nhiệm vụ. Tính năng cộng tác đa robot được giới thiệu, cho phép các robot đa dạng làm việc cùng nhau. Gemini Robotics ER 2 đạt độ chính xác 57.4% trong phân loại tiến độ và 91.3% trong các tác vụ tìm kiếm thời điểm với độ trễ dưới một giây. Nó vượt trội hơn các mô hình trước đó trên các tiêu chuẩn an toàn, bao gồm dừng robot hình người khi có người ở gần. Mô hình có sẵn công khai qua Gemini API, Google AI Studio, và trong bản xem trước riêng tư trên Gemini Enterprise Agent Platform.
Nguồn: Google DeepMind — bản gốc
Bài viết liên quan trước đây ↓
Tin mới