Google DeepMind stellt SL2T vor, ein Gebärdensprach-Übersetzungsmodell für Zeichen-zu-Text auf Pixel 11
Google/DeepMind
DeepMind
Google DeepMind hat SL2T vorgestellt, ein Modell zur Übersetzung von Gebärdensprache in Text, und es in Gboard und Live Transcribe auf Pixel 11 für die Übersetzung von Amerikanischer Gebärdensprache ins Englische integriert. Das Modell wurde mit über 100.000 Stunden Daten aus mehr als 50 Gebärdensprachen trainiert und erreicht einen Zero-Shot-BLEURT-Score von 70 auf FLEURS-ASL. SL2T wurde in Zusammenarbeit mit der Gehörlosengemeinschaft entwickelt und übersetzt von Pose-Landmarken in Text, was den Einsatz in der Praxis unterstützt.
Google DeepMind hat SL2T vorgestellt, ein massiv mehrsprachiges Modell für die Übersetzung von Gebärdensprache in Text, das neue Gebärdensprachfunktionen für gehörlose und schwerhörige Nutzer unterstützt. Es ist die erste Integration in ein Verbraucherprodukt, mit Gebärdensprache-zu-Text-Diktat in Gboard und Live Transcribe auf Pixel 11, beginnend mit Amerikanischer Gebärdensprache (ASL) ins Englische. Das Modell wurde mit über 100.000 Stunden Daten aus mehr als 50 Gebärdensprachen trainiert, wobei etwa ein Viertel auf ASL entfällt. SL2T übersetzt direkt von Posen-Landmarkensequenzen in Text, ohne Zwischenstufen (Glossen), und verwendet On-Device-Tracking (MediaPipe Holistic) für den Datenschutz. Laut Benchmarks wie FLEURS-ASL erreicht SL2T einen Zero-Shot-Wert von 70 BLEURT. Die Entwicklung war gemeinschaftsgetrieben, wobei das KI-Gebärdensprach-Beratungsgremium (AISLAC) die verantwortungsvolle Bereitstellung begleitete. Zukünftige Pläne umfassen die Erweiterung auf weitere Gebärdensprachen und die Generierung von Gebärdensprache.
Quelle: Google DeepMind —
Original
