微軟 Webwright 將 Web Agent 開源,從「點擊」轉向「編碼」
微軟研究院(Microsoft Research)最近將其全新的網頁代理框架Webwright 開源。該框架不再依賴主流的「螢幕截圖/DOM 點擊」預測模型,而是讓 AI 模型能直接編寫Playwright程式碼,並在終端機中執行 Bash 指令,從而更有效率且更合乎邏輯地完成複雜的網頁任務。

I. 核心架構:極簡主義的「終端機優先」方法
Webwright 的設計哲學十分簡明:「一個終端機勝過數千層抽象。」該框架由約1,000 行程式碼組成,分為三個核心模組,且不涉及複雜的多代理協調機制:
Runner(約 150 行):管理代理迴圈的核心邏輯,負責處理上下文與執行。
Model Endpoint(約 550 行):用於與模型互動的統一介面,支援 OpenAI、Anthropic 和 OpenRouter 等後端服務。
終端環境(約 300 行):提供一個隔離的終端執行環境,模型可在其中執行 Playwright 腳本、檢視日誌、分析螢幕截圖並進行除錯。
工作流程:Runner 將當前任務上下文傳送至模型 → 模型生成「思考過程」與「Shell 指令」 → 執行環境執行並回傳結果(輸出、螢幕截圖、錯誤堆疊) → 循環持續進行直至任務完成。

II. 為何要從「點擊」轉向「編寫程式碼」?
當前主流的代理程式透過不斷預測「點擊、捲動、輸入」來操作瀏覽器,這會導致效率問題及狀態管理上的挑戰。Webwright 的程式碼驅動方法具備明顯優勢:
邏輯重複利用:每項操作都會產生可重複使用的 RPA(機器人流程自動化)腳本,而非一次性點擊記錄。這些腳本可在 Claude Code 或 Codex 等其他工具中重複使用。
複雜邏輯處理:程式碼天生支援迴圈、函式與分支。對於表單填寫、跨頁面操作及條件跳轉等長鏈任務,程式碼的表現遠勝於單純堆疊動作。
工程化錯誤修正:透過分析執行錯誤後的堆疊追蹤,模型能自主進入「編寫程式碼-執行-出錯-修正」的迭代循環,顯著提升任務成功率。
III. 工程突破:解決「假成功」與「上下文膨脹」
Webwright 針對代理程式常見的兩大痛點提出針對性解決方案:
閘門自我檢查機制:防止模型錯誤地宣稱任務已完成。模型必須先生成「自我檢查配置」,並在乾淨的環境中執行最終腳本。只有在自我反思確認任務確實達成後,才能輸出完成標記。
歷史記錄壓縮:為處理長軌跡造成的上下文過載,系統每 20 步將歷史記錄壓縮為摘要,確保上下文視窗始終聚焦於關鍵進展。
IV. 測試表現:超越基準測試
在 2026 年 5 月的基準測試中,Webwright 表現極為出色:
Online-Mind2Web:基於 GPT-5.4 的 Webwright 在 100 步預算內達到86.67%的準確度,名列頂尖開源解決方案之列。
Odysseys(長鏈任務):面對平均長達 272 字的複雜指令, Webwright 搭配 GPT-5.4 取得60.1% 的準確率,相較於基礎版 GPT-5.4(33.5%)提升約81.5%,並超越 4 月份排行榜冠軍 Opus4.6(44.5%)。
業界反饋
Webwright 的問世凸顯了一項重要趨勢:隨著模型的程式設計能力提升,代理程式正朝著「開發者範式」轉變。透過將瀏覽器視為可程式化的終端點,而非僅僅是互動介面,Webwright 成功將 AI 網頁任務執行的效率與穩健性提升至全新層次。
對開發者而言,Webwright 不僅是一個代理程式框架——它更是一位能夠自動編寫、維護及打包自動化腳本的「超級員工」。該專案現已於 GitHub 上開源。
相關文章
韓國啟動國家人工智慧計算中心建設,投資2.5萬億韓元,目標2028年完成
韓國媒體EtNews報道,韓國AI計算中心(KOACC)的奠基儀式於8月3日在全羅南道順天市的Solar City資料中心園區舉行。該專案總投資額為2.5萬億韓元(約合118.38億元人民幣),計劃於2028年投入運營,成為迄今為止韓國在AI基礎設施領域規模最大的國家投資之一。該專案的股權分佈凸顯了深化政企合作的戰略意圖。三星SDS作為最大股東持有30%的股份,而包括科學技術資訊通訊部、金融監督院和國家成長基金在內的公共實體合計持有29%的股份。NAVER Cloud緊隨其後,持股26.1%,
六大科技巨頭向 Linux 基金會捐贈 1250 萬美元,以應對人工智慧漏洞噪音
為應對由人工智慧自動化工具產生的大量低質量安全報告,六家主要科技公司——Anthropic、亞馬遜(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金會專案提供了 1250 萬美元 的資金支援。這項投資旨在減輕開源軟體(FOSS)維護者手動篩選的工作負擔,使他們能夠專注於真正的安全威脅。隨著人工智慧技術降低了漏洞發現的門檻,開源社羣正面臨前所未有的挑戰:無效報告:自動生成的 AI 報告使維護者應接不暇。雖然數量龐大,但這些提交往往缺乏深度,
馬斯克曾考慮將OpenAI留給他的孩子,而奧特曼正在作證
今早,OpenAI 執行長山姆·阿爾特曼出庭作證,回應前聯合創始人埃隆·馬斯克針對該公司企業結構提起的訴訟。當被問及馬斯克聲稱其他聯合創始人透過成立一家以營利為目的的子公司來推廣基於人工智慧的產品,從而“竊取了一家慈善機構”的說法時,阿爾特曼表現出明顯的猶豫。“這種說法甚至讓人難以理解,”阿爾特曼在停頓後說道,“我們成立的是全球最大的慈善機構之一。該基金會正在開展令人難以置信的工作,並將繼續做更多事情。”馬斯克的律師團隊指出,OpenAI 基金會目前持有的資產價值約為 2000 億美元
相關專題推薦
評論 (1)
0/500
微軟研究院(Microsoft Research)最近將其全新的網頁代理框架Webwright 開源。該框架不再依賴主流的「螢幕截圖/DOM 點擊」預測模型,而是讓 AI 模型能直接編寫Playwright程式碼,並在終端機中執行 Bash 指令,從而更有效率且更合乎邏輯地完成複雜的網頁任務。

I. 核心架構:極簡主義的「終端機優先」方法
Webwright 的設計哲學十分簡明:「一個終端機勝過數千層抽象。」該框架由約1,000 行程式碼組成,分為三個核心模組,且不涉及複雜的多代理協調機制:
Runner(約 150 行):管理代理迴圈的核心邏輯,負責處理上下文與執行。
Model Endpoint(約 550 行):用於與模型互動的統一介面,支援 OpenAI、Anthropic 和 OpenRouter 等後端服務。
終端環境(約 300 行):提供一個隔離的終端執行環境,模型可在其中執行 Playwright 腳本、檢視日誌、分析螢幕截圖並進行除錯。
工作流程:Runner 將當前任務上下文傳送至模型 → 模型生成「思考過程」與「Shell 指令」 → 執行環境執行並回傳結果(輸出、螢幕截圖、錯誤堆疊) → 循環持續進行直至任務完成。

II. 為何要從「點擊」轉向「編寫程式碼」?
當前主流的代理程式透過不斷預測「點擊、捲動、輸入」來操作瀏覽器,這會導致效率問題及狀態管理上的挑戰。Webwright 的程式碼驅動方法具備明顯優勢:
邏輯重複利用:每項操作都會產生可重複使用的 RPA(機器人流程自動化)腳本,而非一次性點擊記錄。這些腳本可在 Claude Code 或 Codex 等其他工具中重複使用。
複雜邏輯處理:程式碼天生支援迴圈、函式與分支。對於表單填寫、跨頁面操作及條件跳轉等長鏈任務,程式碼的表現遠勝於單純堆疊動作。
工程化錯誤修正:透過分析執行錯誤後的堆疊追蹤,模型能自主進入「編寫程式碼-執行-出錯-修正」的迭代循環,顯著提升任務成功率。
III. 工程突破:解決「假成功」與「上下文膨脹」
Webwright 針對代理程式常見的兩大痛點提出針對性解決方案:
閘門自我檢查機制:防止模型錯誤地宣稱任務已完成。模型必須先生成「自我檢查配置」,並在乾淨的環境中執行最終腳本。只有在自我反思確認任務確實達成後,才能輸出完成標記。
歷史記錄壓縮:為處理長軌跡造成的上下文過載,系統每 20 步將歷史記錄壓縮為摘要,確保上下文視窗始終聚焦於關鍵進展。
IV. 測試表現:超越基準測試
在 2026 年 5 月的基準測試中,Webwright 表現極為出色:
Online-Mind2Web:基於 GPT-5.4 的 Webwright 在 100 步預算內達到86.67%的準確度,名列頂尖開源解決方案之列。
Odysseys(長鏈任務):面對平均長達 272 字的複雜指令, Webwright 搭配 GPT-5.4 取得60.1% 的準確率,相較於基礎版 GPT-5.4(33.5%)提升約81.5%,並超越 4 月份排行榜冠軍 Opus4.6(44.5%)。
業界反饋
Webwright 的問世凸顯了一項重要趨勢:隨著模型的程式設計能力提升,代理程式正朝著「開發者範式」轉變。透過將瀏覽器視為可程式化的終端點,而非僅僅是互動介面,Webwright 成功將 AI 網頁任務執行的效率與穩健性提升至全新層次。
對開發者而言,Webwright 不僅是一個代理程式框架——它更是一位能夠自動編寫、維護及打包自動化腳本的「超級員工」。該專案現已於 GitHub 上開源。
韓國啟動國家人工智慧計算中心建設,投資2.5萬億韓元,目標2028年完成
韓國媒體EtNews報道,韓國AI計算中心(KOACC)的奠基儀式於8月3日在全羅南道順天市的Solar City資料中心園區舉行。該專案總投資額為2.5萬億韓元(約合118.38億元人民幣),計劃於2028年投入運營,成為迄今為止韓國在AI基礎設施領域規模最大的國家投資之一。該專案的股權分佈凸顯了深化政企合作的戰略意圖。三星SDS作為最大股東持有30%的股份,而包括科學技術資訊通訊部、金融監督院和國家成長基金在內的公共實體合計持有29%的股份。NAVER Cloud緊隨其後,持股26.1%,
六大科技巨頭向 Linux 基金會捐贈 1250 萬美元,以應對人工智慧漏洞噪音
為應對由人工智慧自動化工具產生的大量低質量安全報告,六家主要科技公司——Anthropic、亞馬遜(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金會專案提供了 1250 萬美元 的資金支援。這項投資旨在減輕開源軟體(FOSS)維護者手動篩選的工作負擔,使他們能夠專注於真正的安全威脅。隨著人工智慧技術降低了漏洞發現的門檻,開源社羣正面臨前所未有的挑戰:無效報告:自動生成的 AI 報告使維護者應接不暇。雖然數量龐大,但這些提交往往缺乏深度,
馬斯克曾考慮將OpenAI留給他的孩子,而奧特曼正在作證
今早,OpenAI 執行長山姆·阿爾特曼出庭作證,回應前聯合創始人埃隆·馬斯克針對該公司企業結構提起的訴訟。當被問及馬斯克聲稱其他聯合創始人透過成立一家以營利為目的的子公司來推廣基於人工智慧的產品,從而“竊取了一家慈善機構”的說法時,阿爾特曼表現出明顯的猶豫。“這種說法甚至讓人難以理解,”阿爾特曼在停頓後說道,“我們成立的是全球最大的慈善機構之一。該基金會正在開展令人難以置信的工作,並將繼續做更多事情。”馬斯克的律師團隊指出,OpenAI 基金會目前持有的資產價值約為 2000 億美元





首頁






