コンテンツへスキップ
スマートくらし
AI・テック

Gemini 3.5 Flash が Computer Use を内蔵——AI エージェントはなぜ次に「画面の操作」を始めたのか

![Gemini 3.5 Flash Computer Use のコンセプトイメージ](https://images.unsplash.com/photo-1558655146-9f40138edfeb?w=800&q=80) # Gemini 3.5 Flash が Computer Use を内蔵——AI エー...

【PR】当サイトはアフィリエイト広告(Amazonアソシエイト含む)を掲載しています。

📋目次

Gemini 3.5 Flash Computer Use のコンセプトイメージ

Gemini 3.5 Flash が Computer Use を内蔵——AI エージェントはなぜ次に「画面の操作」を始めたのか

はじめに:AI は「アドバイス」から「実行」へ

2026年6月24日、Google は Gemini 3.5 Flash に「Computer Use」を標準機能として統合すると発表しました。これは、これまで単体モデルとして提供されていた「Gemini 2.5 Computer Use」を、メインフラッシュモデルの方に内包化するという意味です。

この変更は、AI が「何かを教えてくれるもの」から「実際に画面の上で動いてくれるもの」へと移行する大きな転換点となります。開発者は今後、ブラウザ上のフォーム入力、モバイルアプリの操作、デスクトップアプリケーションの処理——これらを一つの AI エージェントにまとめて任せることができるようになるのです。

OpenAI が初のカスタムチップ「Jalapeño」を発表したばかりの今、AI インフラの競争はコスト削減だけでなく「AI がどう動くか」そのものの変化も加速させています。


Computer Use とは——AI に「目」と「手」を与える技術

従来の AI エージェントの限界

これまでの AI エージェントは、API を通じて特定のツールを呼び出す仕組みが主でした。開発者が事前に定義した範囲でしか動けません。

しかし現実の仕事は、API でラップされていない操作の連続です。Web のフォーム入力、社内システムからデータ抽出、モバイルアプリの設定変更、複数タブの情報収集——これらを一つずつコードで定義するのは非現実的です。

Computer Use が操作する画面のイメージ

従来の方法と Computer Use の違い

方式操作範囲柔軟性開発コスト
Function Calling / API 連携事前定義された機能のみ高(実装が必要)
RAG + コード実行データ処理と推論に特化
Computer Use(画面操作)画面上のあらゆる操作低(自然言語で指示)

Computer Use の基本的な仕組み

Computer Use を搭載した AI エージェントは、以下のステップで動作します。

  1. 画面の認識:スクリーンショットを取得し、現在の状態を理解する。AI は画像認識モデルを使って UI 要素を特定し、テキスト領域(OCR)やボタン・リンクなどのインタラクションポイントを抽出する
  2. 意思決定:AI が「次に何すべきか」を判断する。ユーザーの指示と画面の状態を照合し、最適なアクションを選択する
  3. 操作の実行:クリック、スクロール、キー入力などのアクションを実行する。マウス座標やキーコードを正確に送信することで、人間が実際にマウスとキーボードを使うのとほぼ同じ挙動を実現する
  4. 結果の確認:操作後の画面状態を確認し、次の手順を決定する。AI は実行した操作の結果を検証し、意図しない変化がないかチェックする

このサイクルを繰り返すことで、AI は人間がマウスとキーボとキーボードで行うのとほぼ同じ操作を自律的に行えます。ただし、実際の運用では「画面の認識」に数秒から数十秒かかることもあり、複雑なタスクでは全体で数分〜十数分の時間がかかることを理解しておく必要があります。


Gemini 3.5 Flash の Computer Use がもたらすもの

Flash モデルへの統合という意味

従来の Gemini 2.5 では、Computer Use は専用のモデルとして提供されていました。開発者は通常の推論タスクと Computer Use タスクでモデルを使い分ける必要があり、システム構成は複雑でした。

Gemini 3.5 Flash への統合により、単一のモデルで通常の会話・推論から画面操作までをシームレスに扱えます。

3つの環境を横断する

Gemini 3.5 Flash の Computer Use は、ブラウザ操作、モバイルアプリ操作、デスクトップ操作の3環境をカバーします。これらは統合的に動作するため、「ブラウザで情報を集め、スプレッドシートにまとめて、メールで送信する」といった一連のワークフローも一つのエージェントで完結できます。

安全性へのアプローチ

Computer Use は強力な分、リスクも伴います。AI が勝手に画面を操作することで、意図しないデータ送信が起こりうることがあります。

Google は、敏感的な操作に対するユーザー確認機能や、プロンプトインジェクションを自動検知して停止する機能を提供します。企業は安全なサンドボックス・ヒューマンインザループ・厳密なアクセス制御と組み合わせて運用できます。

Gemini 3.5 Flash セキュリティ機能の概念図


具体的なユースケース——どんなことが自動化できるのか

フォーム入力やデータ転記

Web のフォームに入力する作業は、多くの人が日常的に行っています。手動で入力するのは時間がかかるだけでなく、誤字脱字のリスクもあります。Computer Use を使えば、「このフォームに名前と住所を入力して送信してください」といった自然言語の指示だけで、AI が適切なフィールドを特定し、値を入力・送信できます。

また、複数の Web サイトから情報を収集して Excel や Google スプレッドシートにまとめる作業も自動化可能です。「Amazon のベストセラーランキング 10 位までをリストアップして CSV に出力してください」と指示すれば、AI は各ページを巡回し、データを抽出・整形してファイルとして保存してくれます。

Web スクレイピングの進化

従来のスクレイピングは HTML パースや CSS セレクターの知識が必要で、サイト構造が変わるとすぐに壊れていました。Computer Use なら「このサイトの製品ページから価格と在庫数を取得してください」と指示するだけで、AI が動的に UI を読み取りながらデータを収集できます。JavaScript でレンダリングされた要素も問題なく扱えるため、現代の Web サイトとの親和性が高いです。

マルチステップワークフロー

複数のタスクを連続して実行するワークフローも可能になります。「旅行サイトの比較ページを開いて、3 つの航空会社の往復便料金をメモし、それをメールで送ってください」といった指示は、ブラウザ操作からデータ抽出、メール作成までを一連の流れとして処理できます。これにより、開発者は API を一つずつ定義する必要がなくなり、自然言語だけで複雑なタスクを指定できるようになります。

モバイルアプリの操作

Computer Use はモバイルアプリにも対応します。「このアプリで新しいアカウントを作成して、プロフィール画像を設定してください」といった指示は、スマホの画面を認識し、タップやキーボード入力をシミュレートすることで実現できます。ただし、モバイル環境ではタッチイベントの精度や、通知バナーなどの UI 要素が操作を邪魔することがあるので、適切なハンドリングが必要です。

デスクトップアプリケーションとの連携

デスクトップアプリ(例:スプレッドシートソフト、メールクライアント)も対象となります。「この Excel ファイルを開いて、A1 セルに『売上データ』と入力してください」といった指示は、OS 上のアプリケーションを認識し、キーボード入力をシミュレートすることで実行できます。ただし、セキュリティ上、ファイルの読み書きやネットワーク通信には制限がかかる場合があるため、サンドボックス環境での実行が推奨されます。


なぜ今 Computer Use なのか——Google の戦略

AI エージェント市場の激化

2026 年、AI エージェント市場は巨大な戦略的投資を集めています。Anthropic は Claude のツール利用能力を強化し、OpenAI はエージェント製品「Codex」を展開中です。AI が「ただのチャットボット」から「実際に動くエージェント」へと進化する中で、画面操作能力は必須の差別化要因となっています。

Google にとって Gemini 3.5 Flash への Computer Use 統合は、Vertex AI / Google Cloud との親和性、Google Workspace との統合、そして検索・インデックス技術の優位性という 3 つの戦略的意味を持ちます。

市場における位置づけ

Computer Use の登場は、AI エージェントが「画面」という新しいインターフェースを獲得したことを意味します。従来の API 連携では対応できなかった領域——Web サイトの動的コンテンツ、モバイルアプリの UI、デスクトップアプリケーション——これらを AI が直接操作できるようになったのは画期的です。

特に注目すべきは、Google の検索技術との親和性です。Computer Use は画面を認識・理解するため、検索で得た情報と画面の状態を統合してタスクを実行できます。例えば「最新のニュース記事の要約をまとめてください」といった指示では、AI が検索結果を読み込み、各記事の画面から情報を抽出し、まとまったレポートを作成するといったことが可能になります。

技術的な優位性

Gemini 3.5 Flash は、従来の Large Language Model に加えて、画像認識や OCR(光学文字認識)の能力も内蔵しています。このため、Computer Use ではスクリーンショットからテキストを抽出し、UI 要素を特定する処理がスムーズに行えます。また、Flash モデルへの統合により、推論と画面操作を一つのモデルでシームレスに扱えるようになり、システム構成が大幅に簡素化されました。

競合との比較

OpenAI の Computer Use は主にブラウザ操作に特化しており、モバイルやデスクトップアプリには対応していません。Claude も同様に Web ブラウザでのタスク実行を重視しています。Google の Computer Use はこれらと比べて、3 つの環境(ブラウザ・モバイル・デスクトップ)を統合的にカバーする点で優位性があると言えます。

開発者体験への影響

Computer Use を搭載した AI エージェントは、自然言語だけで複雑なタスクを指定できるため、開発者の負担が大幅に軽減されます。従来の API 連携では、各サービスごとにエンドポイントや認証方式を理解し、コードで定義する必要がありましたが、Computer Use では「このフォームに入力して送信してください」といった指示だけで済みます。ただし、AI の判断が意図と異なる場合の検証・制御は開発者の責任となるため、「何をさせるか」「どう止めるか」「どう検証するか」という設計思考が重要になります。


企業への影響——何が変わるのか

ソフトウェアテストの自動化

Computer Use がもたらす直接的なインパクトの一つがソフトウェアテストです。従来はテストケースをコードで記述し、画面変更に合わせてメンテナンスする必要がありました。しかし Computer Use を搭載した AI エージェントなら、自然言語で指示を与えるだけでテストが実行されます。画面が変わっても AI が適応するため、保守コストは大幅に下がります。

ナレッジワークの効率化

企業のナレッジワーク——調査、データ収集、レポート作成、システム入力——は多くの時間を占めます。Computer Use によって、複数サイトの情報収集・集計、データ転記、メールに基づく予定作成などの作業が自動化できます。

開発者の役割の変化

Computer Use の普及は開発者の仕事も変えます。これまで開発者は「API を書く」「UI テストを書く」「ワークフローをコードで定義する」といった作業が主でした。しかし AI エージェントが画面を直接操作できるようになれば、「何をさせるか」「どう止めるか」「どう検証するか」といった上位の設計に集中できます。


個人ユーザーへの影響

ブラウザ操作の自動化

個人ユーザーにとっても、Computer Use は日常的な作業の効率化につながります。旅行サイトの比較、EC サイトでの商品検索・価格比較、SNS 通知の整理、オンライン申請手続きの完了——これらはすべて「画面の操作」を伴うため、API では対応できなかった領域です。

アクセシビリティの向上

Computer Use は、視覚障害や身体障害を持つ人々のアクセシビリティ向上にも貢献します。従来は画面の操作にマウスやタッチが必要だった多くのタスクを、音声やテキストの指示だけで完結できるようになるからです。

Computer Use によるアクセシビリティ向上のイメージ


今後の展望——Computer Use はどこへ向かうのか

マルチモーダルな操作能力の進化

Computer Use はまだ初期段階です。今後は、音声と画面操作を組み合わせたエージェント体験、デバイスを跨ぐ操作の実現、ユーザーパターンを学習した個人化自動化の提案といった進化が予想されます。

標準化の動き

Computer Use のような画面操作型エージェントは、まだ各社バラバラの実装で提供されています。将来的には標準化団体を通じて標準規格が策定される可能性もあります。これにより、一つのエージェントが複数のサービスで動けるようになります。


まとめ——「動く AI」が日常になる日

Gemini 3.5 Flash への Computer Use 統合は、AI が「答えを出すもの」から「実際に動くもの」へと進化する一つのマイルストーンです。

OpenAI がインフラコストの削減に注力する一方で、Google は AI エージェントの「行動力」を高めることで差別化を図っています。AI の未来はこうした多様な競争によって形作られていきます。

私たちが普段使っている Web サービスやアプリが、そのまま AI エージェントの操作対象になる——そんな時代が近づいています。あなたは明日、どんな仕事を AI に任せてみたいでしょうか。


では、あなたが最初に AI エージェントに任せたい「画面操作」は何でしょうか。

フォーム入力の自動化から始めるか、それとも複数サイトの情報収集から始めるか。Computer Use が開く新しいワークフローの世界へ、一歩踏み出してみてはいかがでしょうか。


関連記事

✍️ この記事を書いた人

スマートくらし 編集部

スマートホーム愛好家として 50 台以上の IoT 製品を自宅でテストしてきた実務経験を持つ。HEMS、音声アシスタント、スマートロック、カメラセンサーなど、住まいに関わるあらゆる IoT 機器の導入・運用・比較評価を専門とする。

スマートホームIoTHEMS音声アシスタントAI 家電