Googleは、手話をテキストに変換する大規模モデル「SL2T」を発表し、Pixel 11を皮切りに実用化を開始した。この技術は、言語の壁だけでなく身体的障壁をテクノロジーで解消する画期的な試みであり、AIが真に「人間中心」のインターフェースへと進化する重要な転換点となるだろう。
Google DeepMindの技術文書によれば、「SL2T(Sign-Language-to-Text)」は、長年研究室の域を出なかった手話AIをコンシューマー製品へと引き上げた点で画期的な成果である。従来の手袋型センサーを用いる手法や複雑な文法解釈を要する方式とは異なり、SL2Tはカメラ映像から抽出した幾何学的座標のみを処理する直接翻訳を実現した。このアプローチにより、プライバシーを保護しつつ、手話特有の非線形な文法構造を直接テキストへ変換することが可能となっている。
SL2Tは50以上の手話言語を学習しており、GoogleのMediaPipe Holisticによる骨格推定技術を活用することで、カメラの生映像ではなく骨格の幾何学的座標のみを処理する。この手法は、プライバシー保護に寄与するだけでなく、手話特有の文脈や表情、身体の向きといった非手動信号までを考慮した自然な文章生成を可能にする。Googleの発表によれば、ベンチマーク「FLEURS-ASL」において70 BLEURTというスコアを記録しており、実用レベルの翻訳精度を裏付けている。
SL2TがPixel 11のGboardとLive Transcribeに搭載されることで、聴覚障害者のデジタルコミュニケーションは劇的に変化する。テスターの評価では、ASLでの手話入力が英語でのタイピングよりも速く、より自然であると報告されている。これにより、ウェブ検索やメッセージ作成、AIアシスタントへの問い合わせといったスマートフォンを通じたデジタルインタラクションの幅が大きく広がる。これはAIが身体的障壁を克服する実用段階に入ったことを示しており、今後のUI/UX設計に大きな影響を与えるだろう。
SL2Tは画期的な進歩であるものの、課題も残る。公開された検証データでは、高速な指文字や稀な表現、時制の解釈において依然として誤変換が見られる。また、左利きユーザーへの対応や片手での操作といった日常の多様性をどこまで許容できるかが普及の鍵を握る。Googleは「聾者コミュニティと共に構築する」姿勢を強調し、専門家による諮問委員会を設置しているが、AIが文化的なニュアンスをどこまで汲み取れるのか、その「翻訳の質」は今後も厳しく問われ続けるはずである。