Googleは、ネイティブなコンピュータ操作をGemini 3.5 Flashに統合することで、マルチモーダル切り替えの障壁を打ち破った。

Google DeepMindチームは、Gemini 3.5 Flashモデルにコンピュータ操作機能を直接統合するという大きなブレークスルーを発表しました。開発者はこれにより、単一のモデルを使用して、ブラウザ、モバイルデバイス、デスクトップ上の画面を自律的に閲覧し、操作を行うAIエージェントを構築できるようになります。
これまではこの機能は別途用意されたモデルとしてのみ利用可能で、開発者は異なるモデル間での複雑な切り替えやコンテキストの移行を自ら処理する必要がありました。しかしネイティブ統合により、長時間にわたるクロスプラットフォームタスクを実行する際にAIが手動で情報を渡す必要がなくなり、開発プロセスが大幅に簡素化されます。
コンテキストの損失を排除し、エージェントの信頼性を向上させる
Googleのチームは、AIエージェントの核心的なボトルネックは個々のツールの制約ではなく、複数のツール間で切り替える際に生じるコンテキスト情報の損失だと考えています。検索機能、地図機能、コンピュータ操作を単一のモデルアーキテクチャ内で統合することで、コンテキストが継続的に流れるようになり、複雑なタスクでの失敗リスクが大幅に低減されます。
この「マルチツール統合」の設計は、内部で接続された単一の建物を構築することに例えられ、別々の建物間で行われる時間のかかる上にエラーが発生しやすい通信を不要にします。このアーキテクチャ上の変更により、エージェントベースのタスクの信頼性や応答遅延が大幅に向上する可能性があります。
複数層のセキュリティ対策を備えた3つの主要なシナリオへの焦点
このネイティブ機能は主に、数時間から数日間にわたって連続して動作する必要がある自動化タスク、UIの一貫性を自動的に確認するための継続的なソフトウェアテスト、複数のアプリケーションにまたがる知識集約型の作業といった3つの主要なシナリオで活用されます。これらのシナリオはタスク間でのコンテキストの連続性に大きく依存しており、繰り返し作業や負荷の高い業務を人間に代わって効果的にこなすことが可能です。
セキュリティ面では、Googleはターゲットを絞った敵対的トレーニング、機密性の高い処理向けの企業向けセキュリティ対策、間接的なプロンプト注入検出など、複数層にわたる防御戦略を採用しています。これらの仕組みが一体となって、オープンで管理されていないコンピュータ環境においても企業ユーザーが比較的完全なセキュリティ境界を構築するのに役立ちます。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500

Google DeepMindチームは、Gemini 3.5 Flashモデルにコンピュータ操作機能を直接統合するという大きなブレークスルーを発表しました。開発者はこれにより、単一のモデルを使用して、ブラウザ、モバイルデバイス、デスクトップ上の画面を自律的に閲覧し、操作を行うAIエージェントを構築できるようになります。
これまではこの機能は別途用意されたモデルとしてのみ利用可能で、開発者は異なるモデル間での複雑な切り替えやコンテキストの移行を自ら処理する必要がありました。しかしネイティブ統合により、長時間にわたるクロスプラットフォームタスクを実行する際にAIが手動で情報を渡す必要がなくなり、開発プロセスが大幅に簡素化されます。
コンテキストの損失を排除し、エージェントの信頼性を向上させる
Googleのチームは、AIエージェントの核心的なボトルネックは個々のツールの制約ではなく、複数のツール間で切り替える際に生じるコンテキスト情報の損失だと考えています。検索機能、地図機能、コンピュータ操作を単一のモデルアーキテクチャ内で統合することで、コンテキストが継続的に流れるようになり、複雑なタスクでの失敗リスクが大幅に低減されます。
この「マルチツール統合」の設計は、内部で接続された単一の建物を構築することに例えられ、別々の建物間で行われる時間のかかる上にエラーが発生しやすい通信を不要にします。このアーキテクチャ上の変更により、エージェントベースのタスクの信頼性や応答遅延が大幅に向上する可能性があります。
複数層のセキュリティ対策を備えた3つの主要なシナリオへの焦点
このネイティブ機能は主に、数時間から数日間にわたって連続して動作する必要がある自動化タスク、UIの一貫性を自動的に確認するための継続的なソフトウェアテスト、複数のアプリケーションにまたがる知識集約型の作業といった3つの主要なシナリオで活用されます。これらのシナリオはタスク間でのコンテキストの連続性に大きく依存しており、繰り返し作業や負荷の高い業務を人間に代わって効果的にこなすことが可能です。
セキュリティ面では、Googleはターゲットを絞った敵対的トレーニング、機密性の高い処理向けの企業向けセキュリティ対策、間接的なプロンプト注入検出など、複数層にわたる防御戦略を採用しています。これらの仕組みが一体となって、オープンで管理されていないコンピュータ環境においても企業ユーザーが比較的完全なセキュリティ境界を構築するのに役立ちます。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






