⚡ EILMELDUNG
ModelleMediengenerierung 🇺🇸 27.07.2026 14:04

Google DeepMind stellt Gemini Omni vor: multimodales Modell zur Videogenerierung und -bearbeitung

Google/DeepMindGoogle/DeepMind DeepMindDeepMind
Google DeepMind hat Gemini Omni vorgestellt, ein multimodales KI-Modell, das Videos aus jeder Kombination von Bildern, Audio, Video und Text generieren und bearbeiten kann. Das erste Modell der Familie, Gemini Omni Flash, wird für Google AI Plus-, Pro- und Ultra-Abonnenten über die Gemini-App und Google Flow ausgerollt und steht YouTube Shorts-Nutzern kostenlos zur Verfügung.
Google DeepMind kündigte Gemini Omni an, ein multimodales Modell, das die Argumentationsfähigkeiten von Gemini mit kreativen Fähigkeiten kombiniert, um Videos aus beliebigen Eingabemodalitäten wie Bildern, Audio, Video und Text zu generieren und zu bearbeiten. Das Modell unterstützt die Bearbeitung von Videos über natürliche Sprache, bewahrt die Konsistenz von Charakteren und Physik über Bearbeitungen hinweg und kann Videos generieren, die auf Geminis echtem Wissen über Physik, Geschichte, Wissenschaft und Kultur basieren. Es bietet Funktionen wie Bearbeitung durch Konversation, Transformation von Szenen, Hinzufügen von Objekten und Verfeinerung über mehrere Runden. Das erste Modell, Gemini Omni Flash, wird weltweit für Google AI Plus-, Pro- und Ultra-Abonnenten über die Gemini-App und Google Flow sowie kostenlos für Nutzer von YouTube Shorts und der YouTube Create App eingeführt. Alle generierten Videos enthalten zur Transparenz SynthID-Digitalwasserzeichen. Der API-Zugang für Entwickler und Unternehmen ist für die kommenden Wochen geplant.
Quelle: Google DeepMind — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten