阿里巴巴推出「Qwen-UI-Agent」,一款適用於真實世界的多模態基礎模型
阿里巴巴正式推出「Qwen-UI-Agent」,這是一款專為在真實世界環境中運作而設計的 GUI 代理基礎模型。該模型涵蓋行動裝置、桌面電腦、網頁及深度搜尋環境,不僅超越傳統的模擬測試,更能跨複雜實體裝置無縫運作。

超越業界領先者的表現
Qwen-UI-Agent 在權威性基準測試與實際環境中均展現出卓越能力:
行動裝置表現:在 MobileWorld 評測中取得 82.1% 的亮眼成績,表現優於多款國際主流旗艦模型。 在其涵蓋超過 100 台實際裝置的自訂基準測試 MobileWorld-Real 中,成功率達 92.2%,並在 Android 日常任務中取得近乎完美的結果。桌面效能:在 OSWorld-Verified 測試中獲得 79.5% 的得分,相較於基準模型,該模型在多項任務中顯著減少了執行步驟。網頁與通用能力:在 WebArena 網頁測試中,該模型於所有對比模型中名列第一。其通用能力與代理能力均超越基礎訓練模型,使其能輕鬆處理長尾請求。彌合模擬與現實之間的鴻溝
為彌合模擬與實際應用之間的鴻溝,Qwen-UI-Agent 採用了一個包含超過 100 部實體手機及 150 多個應用程式的即時行動裝置環境。此架構支援任務建立、軌跡蒐集及模型訓練。 研究團隊還推出了 MobileWorld-Real,這是一套包含超過 400 項任務的實機基準測試,可根據實際裝置效能進行精確的模型選型。

簡化指令與強健安全性
除了標準的圖形使用者介面(GUI)操作外,該模型還能直接執行命令列指令。透過在單次決策中輸出批次動作,它能縮短執行路徑並提升效率。 整個流程中整合了全面的安全機制:該模型會拒絕並終止涉及非法或高風險請求的任務。對於支付、資料刪除或隱私授權等敏感操作,系統會在關鍵步驟暫停,等待使用者確認。
此外,該模型支援超過 100 步的軌跡線上強化學習。結合自適應課程學習,它能持續提升處理具挑戰性長期任務的能力。
專案首頁:https://tongyi-mai.github.io/Qwen-UI-Agent/
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (0)
0/500
阿里巴巴正式推出「Qwen-UI-Agent」,這是一款專為在真實世界環境中運作而設計的 GUI 代理基礎模型。該模型涵蓋行動裝置、桌面電腦、網頁及深度搜尋環境,不僅超越傳統的模擬測試,更能跨複雜實體裝置無縫運作。

超越業界領先者的表現
Qwen-UI-Agent 在權威性基準測試與實際環境中均展現出卓越能力:
行動裝置表現:在 MobileWorld 評測中取得 82.1% 的亮眼成績,表現優於多款國際主流旗艦模型。 在其涵蓋超過 100 台實際裝置的自訂基準測試 MobileWorld-Real 中,成功率達 92.2%,並在 Android 日常任務中取得近乎完美的結果。桌面效能:在 OSWorld-Verified 測試中獲得 79.5% 的得分,相較於基準模型,該模型在多項任務中顯著減少了執行步驟。網頁與通用能力:在 WebArena 網頁測試中,該模型於所有對比模型中名列第一。其通用能力與代理能力均超越基礎訓練模型,使其能輕鬆處理長尾請求。彌合模擬與現實之間的鴻溝
為彌合模擬與實際應用之間的鴻溝,Qwen-UI-Agent 採用了一個包含超過 100 部實體手機及 150 多個應用程式的即時行動裝置環境。此架構支援任務建立、軌跡蒐集及模型訓練。 研究團隊還推出了 MobileWorld-Real,這是一套包含超過 400 項任務的實機基準測試,可根據實際裝置效能進行精確的模型選型。

簡化指令與強健安全性
除了標準的圖形使用者介面(GUI)操作外,該模型還能直接執行命令列指令。透過在單次決策中輸出批次動作,它能縮短執行路徑並提升效率。 整個流程中整合了全面的安全機制:該模型會拒絕並終止涉及非法或高風險請求的任務。對於支付、資料刪除或隱私授權等敏感操作,系統會在關鍵步驟暫停,等待使用者確認。
此外,該模型支援超過 100 步的軌跡線上強化學習。結合自適應課程學習,它能持續提升處理具挑戰性長期任務的能力。
專案首頁:https://tongyi-mai.github.io/Qwen-UI-Agent/
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼





首頁






