微软Webwright将Web Agent开源,从“点击”转向“编码”
微软研究院最近将其新的网络代理框架Webwright 开源。该框架不再依赖主流的“截图/DOM 点击”预测模型,而是允许 AI 模型直接编写Playwright代码并在终端中执行 Bash 命令,从而更高效、更合理地完成复杂的网络任务。

一、核心架构:极简主义的“终端优先”方法
Webwright的设计理念非常直白:“一个终端胜过千层抽象。”该框架由约1,000行代码组成,分为三个核心模块,且不涉及复杂的多代理协调机制:
Runner(约 150 行):管理代理循环的核心逻辑,负责上下文处理和执行。
Model Endpoint(约 550 行):用于模型交互的统一接口,支持 OpenAI、Anthropic 和 OpenRouter 等后端。
终端环境(约 300 行):提供一个隔离的终端执行环境,模型可在其中运行 Playwright 脚本、查看日志、分析截图并进行调试。
工作流:Runner 将当前任务上下文发送给模型 → 模型生成“思维过程”和“Shell 命令” → 环境执行并返回结果(输出、截图、错误堆栈) → 循环持续进行直至任务完成。

II. 为何要从“点击”转向“编写代码”?
当前主流的智能代理通过不断预测“点击、滚动、输入”来操作浏览器,这导致了效率问题和状态管理方面的挑战。Webwright 的代码驱动方法具有明显的优势:
逻辑复用:每次操作都会生成可复用的 RPA(机器人流程自动化)脚本,而非一次性点击记录。这些脚本可在 Claude Code 或 Codex 等其他工具中复用。
复杂逻辑处理:代码天然支持循环、函数和分支。对于表单填写、跨页面操作和条件跳转等长链任务,代码表达方式远比简单的动作堆叠更胜一筹。
工程化错误修正:通过分析执行错误后的堆栈跟踪,模型可自主进入“编写代码—运行—出错—修复”的迭代循环,显著提升任务成功率。
III. 工程突破:解决“虚假成功”与“上下文膨胀”
Webwright针对智能代理的两大常见痛点提出了针对性解决方案:
门控自检机制:防止模型错误地声称任务已完成。模型必须首先生成“自检配置”,并在干净的环境中运行最终脚本。只有在通过自我反思确认任务确实完成后,才能输出完成标记。
历史压缩:为应对长轨迹带来的上下文过载问题,系统每 20 步将历史数据压缩为摘要,确保上下文窗口始终聚焦于关键进展。
IV. 测试性能:超越基准
在 2026 年 5 月的基准测试中,Webwright 表现尤为出色:
Online-Mind2Web:基于 GPT-5.4 的 Webwright 在 100 步预算内实现了86.67%的准确率,跻身顶级开源解决方案之列。
Odysseys(长链任务):面对平均长度为272个单词的复杂指令, Webwright + GPT-5.4 获得了60.1% 的得分,较基础版 GPT-5.4(33.5%)提升了约81.5%,超越了 4 月份排行榜冠军 Opus4.6(44.5%)。
业界反馈
Webwright 的出现凸显了一个重要趋势:随着模型编程能力的提升,智能代理正向“开发者范式”转变。通过将浏览器视为可编程的端点而非单纯的交互界面,Webwright 成功将 AI 网页任务执行的效率和鲁棒性提升到了一个新高度。
对于开发者而言,Webwright 不仅仅是一个代理框架——它更像是一位能够自动编写、维护和打包自动化脚本的“超级员工”。该项目现已在 GitHub 上开源。
相关文章
六大科技巨头向 Linux 基金会捐赠 1250 万美元,以应对人工智能漏洞噪音
为应对由人工智能自动化工具产生的大量低质量安全报告,六家主要科技公司——Anthropic、亚马逊(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金会项目提供了 1250 万美元 的资金支持。这项投资旨在减轻开源软件(FOSS)维护者手动筛选的工作负担,使他们能够专注于真正的安全威胁。随着人工智能技术降低了漏洞发现的门槛,开源社区正面临前所未有的挑战:无效报告:自动生成的 AI 报告使维护者应接不暇。虽然数量庞大,但这些提交往往缺乏深度,
马斯克曾考虑将OpenAI留给他的孩子,而奥特曼正在作证
今早,OpenAI 首席执行官山姆·阿尔特曼出庭作证,回应前联合创始人埃隆·马斯克针对该公司企业结构提起的诉讼。当被问及马斯克声称其他联合创始人通过成立一家以营利为目的的子公司来推广基于人工智能的产品,从而“窃取了一家慈善机构”的说法时,阿尔特曼表现出明显的犹豫。“这种说法甚至让人难以理解,”阿尔特曼在停顿后说道,“我们成立的是全球最大的慈善机构之一。该基金会正在开展令人难以置信的工作,并将继续做更多事情。”马斯克的律师团队指出,OpenAI 基金会目前持有的资产价值约为 2000 亿美元
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
相关专题推荐
评论 (1)
0/500
微软研究院最近将其新的网络代理框架Webwright 开源。该框架不再依赖主流的“截图/DOM 点击”预测模型,而是允许 AI 模型直接编写Playwright代码并在终端中执行 Bash 命令,从而更高效、更合理地完成复杂的网络任务。

一、核心架构:极简主义的“终端优先”方法
Webwright的设计理念非常直白:“一个终端胜过千层抽象。”该框架由约1,000行代码组成,分为三个核心模块,且不涉及复杂的多代理协调机制:
Runner(约 150 行):管理代理循环的核心逻辑,负责上下文处理和执行。
Model Endpoint(约 550 行):用于模型交互的统一接口,支持 OpenAI、Anthropic 和 OpenRouter 等后端。
终端环境(约 300 行):提供一个隔离的终端执行环境,模型可在其中运行 Playwright 脚本、查看日志、分析截图并进行调试。
工作流:Runner 将当前任务上下文发送给模型 → 模型生成“思维过程”和“Shell 命令” → 环境执行并返回结果(输出、截图、错误堆栈) → 循环持续进行直至任务完成。

II. 为何要从“点击”转向“编写代码”?
当前主流的智能代理通过不断预测“点击、滚动、输入”来操作浏览器,这导致了效率问题和状态管理方面的挑战。Webwright 的代码驱动方法具有明显的优势:
逻辑复用:每次操作都会生成可复用的 RPA(机器人流程自动化)脚本,而非一次性点击记录。这些脚本可在 Claude Code 或 Codex 等其他工具中复用。
复杂逻辑处理:代码天然支持循环、函数和分支。对于表单填写、跨页面操作和条件跳转等长链任务,代码表达方式远比简单的动作堆叠更胜一筹。
工程化错误修正:通过分析执行错误后的堆栈跟踪,模型可自主进入“编写代码—运行—出错—修复”的迭代循环,显著提升任务成功率。
III. 工程突破:解决“虚假成功”与“上下文膨胀”
Webwright针对智能代理的两大常见痛点提出了针对性解决方案:
门控自检机制:防止模型错误地声称任务已完成。模型必须首先生成“自检配置”,并在干净的环境中运行最终脚本。只有在通过自我反思确认任务确实完成后,才能输出完成标记。
历史压缩:为应对长轨迹带来的上下文过载问题,系统每 20 步将历史数据压缩为摘要,确保上下文窗口始终聚焦于关键进展。
IV. 测试性能:超越基准
在 2026 年 5 月的基准测试中,Webwright 表现尤为出色:
Online-Mind2Web:基于 GPT-5.4 的 Webwright 在 100 步预算内实现了86.67%的准确率,跻身顶级开源解决方案之列。
Odysseys(长链任务):面对平均长度为272个单词的复杂指令, Webwright + GPT-5.4 获得了60.1% 的得分,较基础版 GPT-5.4(33.5%)提升了约81.5%,超越了 4 月份排行榜冠军 Opus4.6(44.5%)。
业界反馈
Webwright 的出现凸显了一个重要趋势:随着模型编程能力的提升,智能代理正向“开发者范式”转变。通过将浏览器视为可编程的端点而非单纯的交互界面,Webwright 成功将 AI 网页任务执行的效率和鲁棒性提升到了一个新高度。
对于开发者而言,Webwright 不仅仅是一个代理框架——它更像是一位能够自动编写、维护和打包自动化脚本的“超级员工”。该项目现已在 GitHub 上开源。
六大科技巨头向 Linux 基金会捐赠 1250 万美元,以应对人工智能漏洞噪音
为应对由人工智能自动化工具产生的大量低质量安全报告,六家主要科技公司——Anthropic、亚马逊(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金会项目提供了 1250 万美元 的资金支持。这项投资旨在减轻开源软件(FOSS)维护者手动筛选的工作负担,使他们能够专注于真正的安全威胁。随着人工智能技术降低了漏洞发现的门槛,开源社区正面临前所未有的挑战:无效报告:自动生成的 AI 报告使维护者应接不暇。虽然数量庞大,但这些提交往往缺乏深度,
马斯克曾考虑将OpenAI留给他的孩子,而奥特曼正在作证
今早,OpenAI 首席执行官山姆·阿尔特曼出庭作证,回应前联合创始人埃隆·马斯克针对该公司企业结构提起的诉讼。当被问及马斯克声称其他联合创始人通过成立一家以营利为目的的子公司来推广基于人工智能的产品,从而“窃取了一家慈善机构”的说法时,阿尔特曼表现出明显的犹豫。“这种说法甚至让人难以理解,”阿尔特曼在停顿后说道,“我们成立的是全球最大的慈善机构之一。该基金会正在开展令人难以置信的工作,并将继续做更多事情。”马斯克的律师团队指出,OpenAI 基金会目前持有的资产价值约为 2000 亿美元
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未





首页






