选项
首页
新闻
腾讯推出WorkBuddy Bench:一个集代码、Web、Office和安全于一体的编程智能代理测试平台

腾讯推出WorkBuddy Bench:一个集代码、Web、Office和安全于一体的编程智能代理测试平台

2026-08-28
93

从历史上看,编程代理一直局限于狭窄的领域——例如在 SWE-bench 上修复 bug 或在 Design2Code 上完成前端任务——而生产环境中的基准测试则在很大程度上无法供外部审查。 腾讯通过 WorkBuddy Bench 填补了这一空白,这是一套多领域评估套件,其详细内容已在近期发表于 arXiv 的论文中阐述。其显著特征不在于任务量,而在于其专门设计用于防止答案背诵的架构。

该基准测试涵盖四个专业领域:软件工程(代码库级代码)、前端开发(Web 构建产物)、业务运营(多文件办公工作流)以及网络安全(红蓝队场景)。 该套件分别包含80、70、50和60个任务,共计260个。 关键在于,所有任务均非源自公开题库;而是通过反向工程从真实的代码提交、拉取请求或业务场景中提取,随后重新表述为简洁、口语化且采用角色扮演形式的提示。 这种方法确保通过在线搜索相应的拉取请求或提交线索无法获得结果,从而有效阻止死记硬背。由于数据集完全公开——包括目录、环境镜像、评估工具、测试用例和参考解决方案——其抗污染性依赖于这种构建方法和版本控制,而非隐蔽性。

image.png

虽然这四个子集共享统一的目录结构,但每个子集采用的验证指标各不相同,因此子集之间的直接分数比较无效。 因此,腾讯不公布综合套件得分。代码任务通过隐藏的测试通过率进行评估;Web 任务结合规则检查与 LLM/VLM 及代理评估,要求在断开实时互联网连接的情况下沿指定路径交付成果; 办公任务采用权重为0.70–0.95的确定性规则检查,并结合基于证据的LLM评估;安全任务则依赖于确定性scoring.py脚本,该脚本运行三次取平均值,且不将大型模型作为评判者。 安全子集实现了五层反作弊机制:禁用字面量扫描、重命名输入、掩盖被篡改的测试、编码依赖关系,以及使用权重较低的诱饵任务。 该子集包含38个红队任务和22个蓝队任务,其中白盒审计基于binutils、curl和nginx中真实存在的CVE漏洞。

任务创建遵循标准化流程:源代码收集、重写为真实请求、工作区组装、运行后隔离评估资产,以及打包到独立目录中。整个过程中用户数据始终保持原样。代码任务分配了五个不同的角色(开发人员、算法工程师、产品经理、质量保证人员、运维人员),而安全任务则分配了专业角色。 系统故意提供不完整的信息——目标文件、模式和边界均被隐去——迫使参与者独立获取上下文。评分资产仅在执行后揭示,确保参与者在操作过程中绝不会接触到它们。

评估在隔离的容器中进行,模型环境与沙箱环境相互分离。该框架采用 CodeBuddy Code(默认)和 Claude Code,在增强推理能力并使用 20 万字符上下文窗口的同时,禁用了 WebSearch 和 AskUserQuestion 功能。这一限制至关重要:禁用在线搜索可验证抗污染机制是否按预期运行。

排行榜对多个模型家族进行了排名(评分范围0–100,思考模式,三项平均值)。Claude Opus4.8在代码、网络、办公和安全领域占据榜首,共获得五项第一名;GLM-5.2在两个安全类别中领先,GPT-5.5则在办公类cc中排名第一。 该评估框架展现出较高的敏感度,尤其在安全领域,平均绝对排名变化高达8.6分。在cc框架下,Claude Opus4.8拒绝了13个答案,而GPT-5.5在cbc框架下仅拒绝了2个答案。 在效率方面,GPT-5.5 在保持具有竞争力的分数的同时生成的令牌数量最少,而 DeepSeek-V4-Pro 则以高令牌吞吐量完成了 44 轮代码生成,这反映出其采用了一种更耗资源的方法。

相关文章
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
如何修复核心网页指标以获得更好的 SEO 排名 如何修复核心网页指标以获得更好的 SEO 排名 利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (0)
0/500
OR