选项
首页
新闻
微软Webwright将Web Agent开源,从“点击”转向“编码”

微软Webwright将Web Agent开源,从“点击”转向“编码”

2026-08-03
80

微软研究院最近将其新的网络代理框架Webwright 开源。该框架不再依赖主流的“截图/DOM 点击”预测模型,而是允许 AI 模型直接编写Playwright代码并在终端中执行 Bash 命令,从而更高效、更合理地完成复杂的网络任务。

image.png

一、核心架构:极简主义的“终端优先”方法

Webwright的设计理念非常直白:“一个终端胜过千层抽象。”该框架由约1,000行代码组成,分为三个核心模块,且不涉及复杂的多代理协调机制:

Runner(约 150 行):管理代理循环的核心逻辑,负责上下文处理和执行。

Model Endpoint(约 550 行):用于模型交互的统一接口,支持 OpenAI、Anthropic 和 OpenRouter 等后端。

终端环境(约 300 行):提供一个隔离的终端执行环境,模型可在其中运行 Playwright 脚本、查看日志、分析截图并进行调试。

工作流:Runner 将当前任务上下文发送给模型 → 模型生成“思维过程”和“Shell 命令” → 环境执行并返回结果(输出、截图、错误堆栈) → 循环持续进行直至任务完成。

image.png

II. 为何要从“点击”转向“编写代码”?

当前主流的智能代理通过不断预测“点击、滚动、输入”来操作浏览器,这导致了效率问题和状态管理方面的挑战。Webwright 的代码驱动方法具有明显的优势:

逻辑复用:每次操作都会生成可复用的 RPA(机器人流程自动化)脚本,而非一次性点击记录。这些脚本可在 Claude Code 或 Codex 等其他工具中复用。

复杂逻辑处理:代码天然支持循环、函数和分支。对于表单填写、跨页面操作和条件跳转等长链任务,代码表达方式远比简单的动作堆叠更胜一筹。

工程化错误修正:通过分析执行错误后的堆栈跟踪,模型可自主进入“编写代码—运行—出错—修复”的迭代循环,显著提升任务成功率。

III. 工程突破:解决“虚假成功”与“上下文膨胀”

Webwright针对智能代理的两大常见痛点提出了针对性解决方案:

门控自检机制:防止模型错误地声称任务已完成。模型必须首先生成“自检配置”,并在干净的环境中运行最终脚本。只有在通过自我反思确认任务确实完成后,才能输出完成标记。

历史压缩:为应对长轨迹带来的上下文过载问题,系统每 20 步将历史数据压缩为摘要,确保上下文窗口始终聚焦于关键进展。

IV. 测试性能:超越基准

在 2026 年 5 月的基准测试中,Webwright 表现尤为出色:

Online-Mind2Web:基于 GPT-5.4 的 Webwright 在 100 步预算内实现了86.67%的准确率,跻身顶级开源解决方案之列。

Odysseys(长链任务):面对平均长度为272个单词的复杂指令, Webwright + GPT-5.4 获得了60.1% 的得分,较基础版 GPT-5.4(33.5%)提升了约81.5%,超越了 4 月份排行榜冠军 Opus4.6(44.5%)。

业界反馈

Webwright 的出现凸显了一个重要趋势:随着模型编程能力的提升,智能代理正向“开发者范式”转变。通过将浏览器视为可编程的端点而非单纯的交互界面,Webwright 成功将 AI 网页任务执行的效率和鲁棒性提升到了一个新高度。

对于开发者而言,Webwright 不仅仅是一个代理框架——它更像是一位能够自动编写、维护和打包自动化脚本的“超级员工”。该项目现已在 GitHub 上开源。

相关文章
六大科技巨头向 Linux 基金会捐赠 1250 万美元,以应对人工智能漏洞噪音 六大科技巨头向 Linux 基金会捐赠 1250 万美元,以应对人工智能漏洞噪音 为应对由人工智能自动化工具产生的大量低质量安全报告,六家主要科技公司——Anthropic、亚马逊(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金会项目提供了 1250 万美元 的资金支持。这项投资旨在减轻开源软件(FOSS)维护者手动筛选的工作负担,使他们能够专注于真正的安全威胁。随着人工智能技术降低了漏洞发现的门槛,开源社区正面临前所未有的挑战:无效报告:自动生成的 AI 报告使维护者应接不暇。虽然数量庞大,但这些提交往往缺乏深度,
马斯克曾考虑将OpenAI留给他的孩子,而奥特曼正在作证 马斯克曾考虑将OpenAI留给他的孩子,而奥特曼正在作证 今早,OpenAI 首席执行官山姆·阿尔特曼出庭作证,回应前联合创始人埃隆·马斯克针对该公司企业结构提起的诉讼。当被问及马斯克声称其他联合创始人通过成立一家以营利为目的的子公司来推广基于人工智能的产品,从而“窃取了一家慈善机构”的说法时,阿尔特曼表现出明显的犹豫。“这种说法甚至让人难以理解,”阿尔特曼在停顿后说道,“我们成立的是全球最大的慈善机构之一。该基金会正在开展令人难以置信的工作,并将继续做更多事情。”马斯克的律师团队指出,OpenAI 基金会目前持有的资产价值约为 2000 亿美元
山姆·奥特曼引发关于人工智能减速的辩论 山姆·奥特曼引发关于人工智能减速的辩论 在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
相关专题推荐
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
教育与学习 面向教师、辅导老师和基于群体的学习项目的 AI 测验构建平台
面向教师、辅导老师和基于群体的学习项目的 AI 测验构建平台

2026年最新最佳AI测验构建平台,适用于教师、辅导老师和基于群体的学习项目!XIX.AI精心整理了一份顶级评分列表,包含经过现实世界测试的强力变革性工具,以提供准确的排名。这些必试平台有助于提高写作效率、简化内容创作,并简化各种学习场景中的测验设计。立即探索,发现您解锁教学AI优势的理想工具!

13 个工具
xix.ai
代码 适用于处理重构、漏洞和安全漏洞的 GitHub 团队的 AI 代码提交审查工具
适用于处理重构、漏洞和安全漏洞的 GitHub 团队的 AI 代码提交审查工具

2026年GitHub团队最新最佳AI拉取请求审查工具已登陆XIX.AI!这份精心筛选的高评分清单汇集了功能强大的、具有颠覆性的解决方案,可优化整个团队工作流中的重构、错误修复和安全漏洞检测流程。 通过免费版与付费版的对比分析、实际测试以及详细排名,助您找到能显著提升工作效率的理想工具。立即探索,释放您的AI优势!

12 个工具
xix.ai
文字转语音 最佳AI文本转语音工具,打造自然流畅的旁白
最佳AI文本转语音工具,打造自然流畅的旁白

2026年最新、最受欢迎、评分最高的AI文本转语音工具,助您打造自然流畅的配音,尽在XIX.AI!这份精心挑选的清单汇集了功能强大、颠覆行业的工具,可为各种使用场景提供水晶般清晰的语音,且均经过实际测试验证,并每周更新排名。 获取免费版与付费版的对比分析,找到能立即提升您工作效率的必试解决方案。立即探索,释放您的AI优势!

11 个工具
xix.ai
评论 (1)
0/500
WalterWalker
WalterWalker 2026-09-06 16:00:11

Webwrightのオープンソース化、素晴らしい!スクリーンショットやDOMクリックに頼らず、直接Playwrightコードを生成するって発想が面白いね。これならより柔軟な自動化が期待できそう。でも、生成されたコードの品質管理はどうするんだろ?バグが出た時のデバッグコストが心配だけど、技術的にはかなり興味深い試みだと思う。開発者の手腕次第で大きな影響を与えそう。

OR