Googleは、ロボットの高度な推論とタスク管理を担う新モデル「Gemini Robotics ER 2」を公開した。リアルタイムの映像理解とマルチロボット間の協調を可能にするこの技術は、物理世界で自律的に動くAIエージェントの実用化を大きく前進させるものだ。
Google DeepMindの発表によれば、Gemini Robotics ER 2はロボットの「高次脳」として機能し、状況を理解し自ら判断を下す物理的エージェントへの進化を促す。本モデルはGemini Live APIとの統合により、従来の推論遅延という課題を解消した。これにより、ロボットは連続的な視覚情報に基づきリアルタイムで空間を推論し、複雑なマルチステップタスクの計画を流れるような動作で実行できる。この進化は、ロボットが物理世界でより自律的かつ効率的にタスクを遂行するための重要な一歩である。
ER 2の技術的な核心は、連続的なビデオフィードを用いた進捗管理能力の向上にある。Google DeepMindの技術文書では、特定の動作の終了タイミングを正確に特定する「モーメント・ファインディング」において、91.3%という高い精度を達成したと報告されている。この高精度は平均絶対距離0.96秒というサブ秒単位のレイテンシを実現し、実環境におけるロボットの安全かつ信頼性の高い物理制御を支える。さらに実行速度を前世代比で4倍に向上させ計算コストを削減したことで、リアルタイム性が求められる産業用途での適用が期待される。
Gemini Robotics ER 2は、異なる種類のロボットが共通のセマンティックな理解を通じて連携する「マルチロボット協調」を実装している。これにより、移動が得意な車輪型ロボットと精密作業に長けたヒューマノイドがタスクを分担するような、複雑なワークフローの自動化が可能になる。Googleは本技術をGoogle AI StudioやGemini APIを通じて開発者に公開しており、Boston DynamicsのSpotのような既存プラットフォームへの統合も進んでいる。これは、単一のハードウェアに依存しない汎用的なAI基盤の構築を目指すGoogleの戦略を示している。
Gemini Robotics ER 2は高い推論精度を示すが、産業現場での普及には依然として高いハードルが存在する。物理世界には予期せぬノイズや安全上のリスクが伴うため、AIの判断ミスが物理的な破壊や人身事故に直結するリスクをどう制御するかが最大の課題である。Googleの安全報告書でも、本技術が認定されたハードウェアや機能安全システムに取って代わるものではないと指摘されている。今後はベンチマーク上の数値だけでなく、実環境での長期的な安定稼働実績と、具体的なフェイルセーフ機構の構築が技術の真価を問う試金石となる。