概要
Google DeepMindは2026年8月12日、手話を文字に変換するAIモデル「SL2T(Sign-Language-to-Text)」を発表しました。ろう者・難聴者向けの手話AI技術を、研究段階から実際の製品へと初めて展開する取り組みです。まずはPixel 11の「Gboard」と「Live Transcribe」にアメリカ手話(ASL)から英語への変換機能として搭載されます。
何が発表・更新されたのか
SL2Tは、50以上の手話言語・10万時間以上のデータで学習された、大規模かつ多言語対応の手話翻訳モデルです。学習データの約4分の1はASL(アメリカ手話)が占めています。
このモデルは、Pixel 11のGboard(キーボードアプリ)とLive Transcribe(文字起こしアプリ)に搭載され、ASLでの手話入力を英語のテキストに変換する「手話ディクテーション」機能として提供が始まりました。今後は対応デバイスや対応言語を拡大していく方針が示されています。
技術面では、カメラ映像をそのままサーバーに送るのではなく、端末上で動作する「MediaPipe Holistic」というモデルが手や体の動きを座標(骨格点)として検出し、その座標データのみをサーバーに送信して翻訳する仕組みになっています。映像自体は処理後すぐに破棄されるため、プライバシー保護に配慮した設計です。また、従来手法で使われてきた「グロス」と呼ばれる中間的な注釈を介さず、座標データから直接テキストへ翻訳する方式を採用しており、これにより表情や空間的な表現などの手話特有のニュアンスをより正確に扱えるとしています。
評価指標「FLEURS-ASL」のベンチマークでは、ゼロショット(追加学習なし)でBLEURTスコア70を達成し、従来報告されていたどのスコアよりも高い結果になったとしています。
なぜ重要なのか
世界には200以上の手話言語があり、推定7,000万人のろう者・難聴者が日常的に使用しています。しかし、音声言語の自動翻訳や音声入力技術がこの数十年で大きく進歩した一方、手話向けの技術はほとんど進展してきませんでした。手話は「英語を手で表したもの」ではなく、独自の文法と語彙を持つ独立した言語であり、身体全体の動きを高精度に認識する必要があるため、技術的な難易度が高かった背景があります。SL2Tは、この分野で実用レベルの精度を達成した点が重要とされています。
誰に関係があるのか
- 手話を第一言語とするろう者・難聴者のユーザー
- Pixel 11などGoogle製デバイスを利用する予定がある方
- アクセシビリティ関連のサービスやプロダクトを開発する企業・担当者
- 手話翻訳・多言語対応技術に関心のあるAI開発者や研究者
仕事や業務でどう使えるのか
企業の実務担当者にとっては、直接の業務ツールというよりも、アクセシビリティ対応の参考事例として捉えられる発表です。たとえば、社内の会議やカスタマーサポートでろう者・難聴者とのコミュニケーションを想定する場合、こうした手話AI技術の進展を踏まえて、将来的な対応手段の選択肢として把握しておくと役立ちます。また、自社サービスにアクセシビリティ機能を組み込む際の技術動向としても参考になります。
注意点
公式情報上では、日本語を含む日本での提供状況や、日本手話(JSL)への対応時期については確認できませんでした。現時点ではPixel 11向けにASL(アメリカ手話)から英語への変換機能として提供が始まった段階であり、対応言語・対応デバイスは今後拡大予定とされていますが、具体的な時期や対象プランの詳細は明記されていません。また、公式ブログでは、まれな単語や早い指文字、受動態表現などで誤訳が生じる場合があることも認めています。実運用にあたっては、これらの制約を踏まえた利用が求められます。
公式情報
Putting sign language AI into users’ hands(Google DeepMind Blog)
関連キーワード
- 手話翻訳AI
- Google DeepMind
- Pixel 11
- Gboard
- Live Transcribe
- アクセシビリティ技術
- MediaPipe





