⚡ TIN NÓNG
Google DeepMind giới thiệu Gemini Omni: mô hình đa phương thức tạo và chỉnh sửa video
Google/DeepMind
DeepMind
Google DeepMind vừa công bố Gemini Omni, một mô hình trí tuệ nhân tạo (AI) đa phương thức có khả năng tạo và chỉnh sửa video từ bất kỳ sự kết hợp nào giữa hình ảnh, âm thanh, video và văn bản. Mô hình đầu tiên trong dòng sản phẩm này, Gemini Omni Flash, đang được triển khai cho người dùng Google AI Plus, Pro và Ultra thông qua ứng dụng Gemini và Google Flow, đồng thời sẽ được cung cấp miễn phí cho người dùng YouTube Shorts.
Google DeepMind công bố Gemini Omni, một mô hình đa phương thức kết hợp khả năng suy luận của Gemini với khả năng sáng tạo để tạo và chỉnh sửa video từ bất kỳ phương thức đầu vào nào, bao gồm hình ảnh, âm thanh, video và văn bản. Mô hình hỗ trợ chỉnh sửa video bằng ngôn ngữ tự nhiên, duy trì tính nhất quán của nhân vật và vật lý xuyên suốt các lần chỉnh sửa, đồng thời có thể tạo video dựa trên kiến thức thực tế của Gemini về vật lý, lịch sử, khoa học và văn hóa. Mô hình cung cấp các tính năng như chỉnh sửa qua hội thoại, biến đổi cảnh, thêm đối tượng và tinh chỉnh qua nhiều lượt. Mô hình đầu tiên, Gemini Omni Flash, đang được triển khai cho người đăng ký Google AI Plus, Pro và Ultra trên toàn cầu thông qua ứng dụng Gemini và Google Flow, cũng như cho người dùng YouTube Shorts và YouTube Create App mà không mất phí. Tất cả video được tạo đều có hình mờ kỹ thuật số SynthID để đảm bảo tính minh bạch. Quyền truy cập API dành cho nhà phát triển và doanh nghiệp dự kiến sẽ có trong vài tuần tới.
Nguồn: Google DeepMind —
bản gốc
