谷歌透過將原生計算機操作整合至 Gemini 3.5 Flash 中,打破了多模態切換的壁壘。

Google DeepMind 團隊宣佈取得了重大突破,他們將原生計算機操作能力直接整合到了 Gemini 3.5 Flash 模型中。如今,開發者只需使用同一個模型,就能構建出能夠在瀏覽器、移動裝置和桌面端上自主檢視螢幕內容並執行相應操作的 AI 智慧體。
此前,這項功能僅作為獨立的模型提供,開發者不得不處理不同模型之間的複雜切換與上下文傳遞問題。透過原生整合後,AI 在執行跨平臺的長時任務時無需再手動傳遞資訊,從而大幅簡化了開發流程。
避免上下文丟失以提高智慧體可靠性
Google 的團隊認為,AI 智慧體的核心瓶頸並非單個工具的侷限性,而是在切換不同工具時會出現的上下文資訊丟失問題。透過將搜尋、地圖和計算機操作統一在同一個模型架構中,上下文能夠實現連續流轉,進而顯著降低複雜任務出錯的可能性。
這種“多工具整合”的設計類似於建造一座內部設有連線通道的單一建築,從而避免了多座獨立建築之間繁瑣且易出錯的通訊過程。這樣的架構變革有望大幅提升基於智慧體的任務的可靠性與響應速度。
針對三種核心場景構建多層安全防護體系
這項原生能力將主要應用於三種核心場景:需要連續執行數小時或數天的自動化任務、用於自動驗證 UI 一致性的持續軟體測試,以及涉及多款應用程式的知識密集型工作。這些場景高度依賴任務間的上下文連貫性,能夠有效替代人類執行重複性、高強度的操作。
在安全性方面,Google 採用了多層防禦策略,包括針對性的對抗性訓練、針對敏感操作的企業級安全防護措施,以及間接提示注入檢測功能。這些機制共同幫助企業使用者在開放且缺乏管控的計算機環境中建立起較為完善的安全屏障。
相關文章
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
相關專題推薦
評論 (0)
0/500

Google DeepMind 團隊宣佈取得了重大突破,他們將原生計算機操作能力直接整合到了 Gemini 3.5 Flash 模型中。如今,開發者只需使用同一個模型,就能構建出能夠在瀏覽器、移動裝置和桌面端上自主檢視螢幕內容並執行相應操作的 AI 智慧體。
此前,這項功能僅作為獨立的模型提供,開發者不得不處理不同模型之間的複雜切換與上下文傳遞問題。透過原生整合後,AI 在執行跨平臺的長時任務時無需再手動傳遞資訊,從而大幅簡化了開發流程。
避免上下文丟失以提高智慧體可靠性
Google 的團隊認為,AI 智慧體的核心瓶頸並非單個工具的侷限性,而是在切換不同工具時會出現的上下文資訊丟失問題。透過將搜尋、地圖和計算機操作統一在同一個模型架構中,上下文能夠實現連續流轉,進而顯著降低複雜任務出錯的可能性。
這種“多工具整合”的設計類似於建造一座內部設有連線通道的單一建築,從而避免了多座獨立建築之間繁瑣且易出錯的通訊過程。這樣的架構變革有望大幅提升基於智慧體的任務的可靠性與響應速度。
針對三種核心場景構建多層安全防護體系
這項原生能力將主要應用於三種核心場景:需要連續執行數小時或數天的自動化任務、用於自動驗證 UI 一致性的持續軟體測試,以及涉及多款應用程式的知識密集型工作。這些場景高度依賴任務間的上下文連貫性,能夠有效替代人類執行重複性、高強度的操作。
在安全性方面,Google 採用了多層防禦策略,包括針對性的對抗性訓練、針對敏感操作的企業級安全防護措施,以及間接提示注入檢測功能。這些機制共同幫助企業使用者在開放且缺乏管控的計算機環境中建立起較為完善的安全屏障。
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






