Googleは最新AIモデル「Gemini Omni」と「Gemini 3.5 Flash」を発表した。これらは動画の対話的編集と自律的なエージェント機能を大幅に強化し、AIが単なる生成ツールから複雑なタスクを完遂する実務パートナーへと進化する転換点を示すものである。
Googleが2026年5月のGoogle I/Oで発表したGemini Omniは、動画入力に対して自然言語で指示を重ねることで、物理法則や一貫性を維持したまま映像を編集・変容させる新たな制御手法を実現している。従来の動画生成AIが抱えていた「制御不能なランダム性」を克服し、ビデオ内のオブジェクトを3Dエンジンのアセットのように操作できる点が特徴である。例えば、ランプの位置変更指示に対し、AIは元の空間をリアルに補完し、新しい影や反射を生成するとmindstudio.aiは報じている。実際のビデオ生成はGoogleの専用モデルVeoを通じて行われるが、Geminiの推論レイヤーが入力の理解と編集の意思決定を担う仕組みだ。
Gemini 3.5 Flashは、エージェント機能に特化した軽量かつ高速なモデルであり、新フレームワーク「Antigravity」との連携により、その能力を最大限に引き出す。Antigravityは、AIが複数のサブエージェントを指揮し、複雑なコーディングやデータ整理といった長期間にわたるマルチステップのタスクを自動実行することを可能にする。これは、単なるテキスト生成にとどまらず、より複雑なワークフローを自律的に完遂する能力をAIに与えるものであり、GoogleのAI戦略が「生成」から「実行」へと明確に舵を切ったことを示すものと見られる。
今回の発表で最も注目すべきは、AIが「検索結果を提示する」段階から「ユーザーの代わりにタスクを完遂する」段階へと移行している点である。Googleは、AIエージェントを検索エンジンやWorkspaceツールに深く組み込むことで、ユーザーのデジタルライフを24時間体制で支援する「Gemini Spark」のようなパーソナルエージェントの実現を目指している。検索画面で動的に生成されるパーソナライズされたUIや、自動的に更新される情報エージェントの存在は、Webブラウジングの体験を根本から変える可能性を秘めているとtechnology.inquirer.netは指摘する。
高度な自律性を持つAIエージェントが一般ユーザーに開放されることは、セキュリティやプライバシーの観点で新たなリスクを孕む。特に、個人のメールやドキュメントにアクセスし、外部サービスと連携するエージェント機能は、誤作動や意図しない操作に対するガードレールがどこまで機能するかが問われる。Googleは、この技術をまずはサブスクリプション層から段階的に展開する戦略をとっているが、その先にあるのは、AIが人間の指示を待つのではなく、文脈を理解して先回りして行動する「共生型AI」の時代である。技術的な優位性は明らかだが、今後はその利便性と引き換えに、ユーザーがどれだけAIの判断を信頼し、管理できるかという「信頼の設計」が普及の鍵を握ることになるだろう。