Google DeepMindは、手話をテキストに変換する大規模言語モデル「SL2T」を発表した。50以上の手話言語をリアルタイムでテキスト化するこのモデルは、AIの社会実装における新たなアクセシビリティの基準を提示する。本稿では、技術的なブレイクスルーから実用上の課題までを詳説する。
Google DeepMindが開発した「SL2T」は、従来の手話翻訳システムが依存していた「グロス」と呼ばれる中間注釈層を排除した点が画期的である。グロスは手話単語に固定ラベルを割り当てるため、語彙が制限され、手話特有の非手動マーカーや空間構造といった文法的意味が失われるボトルネックがあった。Googleの技術文書によれば、SL2Tは骨格検知データから直接テキストを生成することで、手話の複雑な表情や非線形な空間表現を含む言語的ニュアンスをより自然に再現することに成功したという。
SL2Tは、2026年8月12日にPixel 11で提供が開始され、GboardやLive Transcribe機能に統合される。同社の発表によると、システムは生ビデオを直接処理せず、デバイス上のMediaPipe Holisticモデルが顔、身体、手の130のキーポイントをフレームごとに追跡する。翻訳のために送信されるのは幾何学的座標のみであり、元のカメラフィードは即座に破棄される設計だ。ユーザーのプライバシー保護を最優先したこの仕組みにより、当初はアメリカ手話(ASL)から英語への翻訳が提供される。
音声認識技術が進化する一方で、世界に200以上存在するとされる手話は、その複雑な解析の難しさからAIの恩恵を十分に受けてこなかった。Googleの技術ブログによれば、SL2Tは50以上の手話言語にわたる10万時間以上のデータでトレーニングされており、その約4分の1はASLのデータである。複数の言語や習熟度レベルで共同トレーニングを行うことで、単一言語システムを上回る汎用的なモデルを生成し、この技術的格差の解消を目指している。
SL2Tの登場により、手話がデジタルデバイスにおける「標準的な入力手段」として定着する可能性が生まれた。聴覚障がいのあるユーザーは、スマートフォンに向かって手話でウェブ検索やメッセージ作成が可能になる。テストユーザーからは、ASLでの手話入力が英語でのタイピングよりも速く直感的であるとの報告が上がっており、これは聴覚障がい者が直面する心理的・物理的なコミュニケーション障壁を根本から解消する一歩となる。AIが「見る」能力を高度化させたことで、真にインクルーシブなデジタル社会の実現が期待される。
SL2Tは高い精度を示すものの、実用化には課題も残る。GoogleとAI手話諮問委員会の見解では、SL2Tは「低リスクのコミュニケーションのための補助ツール」と位置付けられており、不十分な照明や極端なカメラアングル下では精度が低下する可能性がある。多様な方言や、左利き・片手での手話といった身体的個体差への対応も大きな壁である。同社は当事者の視点を開発プロセスに組み込んでいるが、技術の普及には聴覚障がい者コミュニティとの継続的な共創が不可欠であると考えられる。