腾讯推出WorkBuddy Bench:一个集代码、Web、Office和安全于一体的编程智能代理测试平台
从历史上看,编程代理一直局限于狭窄的领域——例如在 SWE-bench 上修复 bug 或在 Design2Code 上完成前端任务——而生产环境中的基准测试则在很大程度上无法供外部审查。 腾讯通过 WorkBuddy Bench 填补了这一空白,这是一套多领域评估套件,其详细内容已在近期发表于 arXiv 的论文中阐述。其显著特征不在于任务量,而在于其专门设计用于防止答案背诵的架构。
该基准测试涵盖四个专业领域:软件工程(代码库级代码)、前端开发(Web 构建产物)、业务运营(多文件办公工作流)以及网络安全(红蓝队场景)。 该套件分别包含80、70、50和60个任务,共计260个。 关键在于,所有任务均非源自公开题库;而是通过反向工程从真实的代码提交、拉取请求或业务场景中提取,随后重新表述为简洁、口语化且采用角色扮演形式的提示。 这种方法确保通过在线搜索相应的拉取请求或提交线索无法获得结果,从而有效阻止死记硬背。由于数据集完全公开——包括目录、环境镜像、评估工具、测试用例和参考解决方案——其抗污染性依赖于这种构建方法和版本控制,而非隐蔽性。

虽然这四个子集共享统一的目录结构,但每个子集采用的验证指标各不相同,因此子集之间的直接分数比较无效。 因此,腾讯不公布综合套件得分。代码任务通过隐藏的测试通过率进行评估;Web 任务结合规则检查与 LLM/VLM 及代理评估,要求在断开实时互联网连接的情况下沿指定路径交付成果; 办公任务采用权重为0.70–0.95的确定性规则检查,并结合基于证据的LLM评估;安全任务则依赖于确定性scoring.py脚本,该脚本运行三次取平均值,且不将大型模型作为评判者。 安全子集实现了五层反作弊机制:禁用字面量扫描、重命名输入、掩盖被篡改的测试、编码依赖关系,以及使用权重较低的诱饵任务。 该子集包含38个红队任务和22个蓝队任务,其中白盒审计基于binutils、curl和nginx中真实存在的CVE漏洞。
任务创建遵循标准化流程:源代码收集、重写为真实请求、工作区组装、运行后隔离评估资产,以及打包到独立目录中。整个过程中用户数据始终保持原样。代码任务分配了五个不同的角色(开发人员、算法工程师、产品经理、质量保证人员、运维人员),而安全任务则分配了专业角色。 系统故意提供不完整的信息——目标文件、模式和边界均被隐去——迫使参与者独立获取上下文。评分资产仅在执行后揭示,确保参与者在操作过程中绝不会接触到它们。
评估在隔离的容器中进行,模型环境与沙箱环境相互分离。该框架采用 CodeBuddy Code(默认)和 Claude Code,在增强推理能力并使用 20 万字符上下文窗口的同时,禁用了 WebSearch 和 AskUserQuestion 功能。这一限制至关重要:禁用在线搜索可验证抗污染机制是否按预期运行。
排行榜对多个模型家族进行了排名(评分范围0–100,思考模式,三项平均值)。Claude Opus4.8在代码、网络、办公和安全领域占据榜首,共获得五项第一名;GLM-5.2在两个安全类别中领先,GPT-5.5则在办公类cc中排名第一。 该评估框架展现出较高的敏感度,尤其在安全领域,平均绝对排名变化高达8.6分。在cc框架下,Claude Opus4.8拒绝了13个答案,而GPT-5.5在cbc框架下仅拒绝了2个答案。 在效率方面,GPT-5.5 在保持具有竞争力的分数的同时生成的令牌数量最少,而 DeepSeek-V4-Pro 则以高令牌吞吐量完成了 44 轮代码生成,这反映出其采用了一种更耗资源的方法。
相关文章
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
相关专题推荐
评论 (0)
0/500
从历史上看,编程代理一直局限于狭窄的领域——例如在 SWE-bench 上修复 bug 或在 Design2Code 上完成前端任务——而生产环境中的基准测试则在很大程度上无法供外部审查。 腾讯通过 WorkBuddy Bench 填补了这一空白,这是一套多领域评估套件,其详细内容已在近期发表于 arXiv 的论文中阐述。其显著特征不在于任务量,而在于其专门设计用于防止答案背诵的架构。
该基准测试涵盖四个专业领域:软件工程(代码库级代码)、前端开发(Web 构建产物)、业务运营(多文件办公工作流)以及网络安全(红蓝队场景)。 该套件分别包含80、70、50和60个任务,共计260个。 关键在于,所有任务均非源自公开题库;而是通过反向工程从真实的代码提交、拉取请求或业务场景中提取,随后重新表述为简洁、口语化且采用角色扮演形式的提示。 这种方法确保通过在线搜索相应的拉取请求或提交线索无法获得结果,从而有效阻止死记硬背。由于数据集完全公开——包括目录、环境镜像、评估工具、测试用例和参考解决方案——其抗污染性依赖于这种构建方法和版本控制,而非隐蔽性。

虽然这四个子集共享统一的目录结构,但每个子集采用的验证指标各不相同,因此子集之间的直接分数比较无效。 因此,腾讯不公布综合套件得分。代码任务通过隐藏的测试通过率进行评估;Web 任务结合规则检查与 LLM/VLM 及代理评估,要求在断开实时互联网连接的情况下沿指定路径交付成果; 办公任务采用权重为0.70–0.95的确定性规则检查,并结合基于证据的LLM评估;安全任务则依赖于确定性scoring.py脚本,该脚本运行三次取平均值,且不将大型模型作为评判者。 安全子集实现了五层反作弊机制:禁用字面量扫描、重命名输入、掩盖被篡改的测试、编码依赖关系,以及使用权重较低的诱饵任务。 该子集包含38个红队任务和22个蓝队任务,其中白盒审计基于binutils、curl和nginx中真实存在的CVE漏洞。
任务创建遵循标准化流程:源代码收集、重写为真实请求、工作区组装、运行后隔离评估资产,以及打包到独立目录中。整个过程中用户数据始终保持原样。代码任务分配了五个不同的角色(开发人员、算法工程师、产品经理、质量保证人员、运维人员),而安全任务则分配了专业角色。 系统故意提供不完整的信息——目标文件、模式和边界均被隐去——迫使参与者独立获取上下文。评分资产仅在执行后揭示,确保参与者在操作过程中绝不会接触到它们。
评估在隔离的容器中进行,模型环境与沙箱环境相互分离。该框架采用 CodeBuddy Code(默认)和 Claude Code,在增强推理能力并使用 20 万字符上下文窗口的同时,禁用了 WebSearch 和 AskUserQuestion 功能。这一限制至关重要:禁用在线搜索可验证抗污染机制是否按预期运行。
排行榜对多个模型家族进行了排名(评分范围0–100,思考模式,三项平均值)。Claude Opus4.8在代码、网络、办公和安全领域占据榜首,共获得五项第一名;GLM-5.2在两个安全类别中领先,GPT-5.5则在办公类cc中排名第一。 该评估框架展现出较高的敏感度,尤其在安全领域,平均绝对排名变化高达8.6分。在cc框架下,Claude Opus4.8拒绝了13个答案,而GPT-5.5在cbc框架下仅拒绝了2个答案。 在效率方面,GPT-5.5 在保持具有竞争力的分数的同时生成的令牌数量最少,而 DeepSeek-V4-Pro 则以高令牌吞吐量完成了 44 轮代码生成,这反映出其采用了一种更耗资源的方法。
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用





首页






