Google DeepMind、SL2Tを発表 Pixel 11で手話からテキストへの翻訳を実現
Google/DeepMind
DeepMind
Google DeepMindは、手話からテキストへの翻訳モデルSL2Tを公開し、Pixel 11のGboardとLive Transcribeにアメリカ手話から英語への翻訳機能として統合しました。このモデルは50以上の手話言語にわたる10万時間以上のデータで訓練され、FLEURS-ASLでゼロショットのBLEURTスコア70を達成しています。聴覚障害者コミュニティと共同開発されたSL2Tは、姿勢ランドマークからテキストへ翻訳し、実際の使用をサポートします。
Google DeepMindは、聴覚障害者および難聴のユーザー向けに新しい手話機能を支える、大規模多言語の手話からテキストへの翻訳モデル「SL2T」を発表しました。これは消費者向け製品への初の統合であり、Pixel 11のGboardとLive Transcribeでの手話からテキストへのディクテーション機能(まずはアメリカ手話(ASL)から英語へ)を提供します。このモデルは、50以上の手話言語にわたる10万時間以上のデータでトレーニングされており、その約4分の1がASLです。SL2Tは、手話の注釈(gloss)を経由せずに、ポーズのランドマーク系列から直接テキストへ翻訳し、プライバシー保護のためオンデバイスでのトラッキング(MediaPipe Holistic)を使用します。FLEURS-ASLなどのベンチマークによると、SL2TはゼロショットでBLEURTスコア70を達成しています。開発はコミュニティ主導で進められ、AI手話諮問委員会(AISLAC)が責任ある展開を指導しました。今後の計画には、さらに多くの手話言語への対応拡大や、手話生成機能の追加が含まれています。
出典: Google DeepMind —
原文
