Google giới thiệu Gemini Robotics 2.0, hứa hẹn cải thiện sự khéo léo và an toàn
Google/DeepMind
Google DeepMind đã giới thiệu Gemini Robotics 2.0, một bộ mô hình mới để điều khiển robot, cho phép robot thực hiện các nhiệm vụ phức tạp hơn, phân tích môi trường thay đổi và tương tác với các robot khác. Thành phần chính, Gemini Robotics ER 2, có sẵn cho các nhà phát triển thông qua Gemini Live API và cho thấy sự cải thiện đáng kể trong việc hiểu video so với phiên bản trước.
Google đã giới thiệu Gemini Robotics 2.0, một bộ mô hình cho phép robot thực hiện các nhiệm vụ phức tạp hơn, phân tích môi trường thay đổi và hợp tác với các robot khác. Cốt lõi là mô hình lý luận nhập thể (embodied reasoning) có tên Gemini Robotics ER 2, được cải tiến đáng kể so với phiên bản 1.6 trước đó. Mô hình này được tích hợp với Gemini Live API, cho phép các nhà phát triển sử dụng các khả năng của nó. ER 2 là một mô hình ngôn ngữ thị giác (vision language model - VLM), có khả năng xử lý các luồng video trực tiếp từ camera của robot để theo dõi tiến trình. Google tuyên bố rằng ER 2 có thể phân loại mức độ hoàn chỉnh của các đoạn video với độ chính xác gần 60%, tốt hơn so với các mô hình trí tuệ nhân tạo (AI) cạnh tranh. Mục tiêu của dự án là tạo ra một robot đa năng có khả năng thực hiện bất kỳ hành động nào của con người, điều này đôi khi được gọi là 'trí tuệ nhân tạo tổng quát vật lý' (physical AGI).
Nguồn: Ars Technica —
bản gốc
