選項
首頁
新聞
騰訊推出 WorkBuddy Bench:一個整合程式碼、網頁、Office 及資安功能的程式設計智慧代理測試平台

騰訊推出 WorkBuddy Bench:一個整合程式碼、網頁、Office 及資安功能的程式設計智慧代理測試平台

2026-08-28
93

從歷史上看,編碼代理程式一直局限於狹窄的領域——例如 SWE-bench 上的錯誤修正,或 Design2Code 上的前端任務——而生產環境的基準測試則大多無法供外部審查。 騰訊透過「WorkBuddy Bench」彌補了這項缺口,這是一套多領域評估套件,其詳情已於近期發表於 arXiv 的論文中闡述。其核心特點不在於任務數量,而在於其專門設計的架構,旨在明確防止系統背誦答案。

此基準測試涵蓋四大專業領域:軟體工程(儲存庫層級程式碼)、前端開發(網頁產出物)、業務營運(多檔案辦公室工作流程)以及網路安全(紅隊與藍隊情境)。 該套件分別包含 80、70、50 及 60 項任務,總計 260 項。 關鍵在於,所有任務均非源自公開題庫;而是透過逆向工程從真實的程式碼提交、拉取請求或商業情境中萃取,並重新表述為簡潔、口語化且具角色扮演性質的提示。 此方法確保透過線上搜尋對應的拉取請求或提交線索均無法獲得結果,從而有效防止死記硬背。由於資料集完全公開——包括目錄、環境映像、評估工具、測試案例及參考解法——其抗污染能力仰賴於此建構方法與版本控制,而非依賴隱蔽性。

image.png

雖然這四個子集均採用統一的目錄結構,但各自採用不同的驗證指標,因此子集之間的直接分數比較並不具參考價值。 因此,騰訊並未公布綜合套件分數。程式碼任務透過隱藏的測試通過率進行評估;網頁任務則結合規則檢查與大型語言模型(LLM)/大型視覺模型(VLM)及代理程式評估,要求參賽者在無實時網路連線的情況下,沿指定路徑提交成果; 辦公室任務採用權重介於 0.70–0.95 之間的確定性規則檢查,並結合基於證據的 LLM 評估;而安全任務則仰賴確定性 scoring.py 腳本,執行三次並取平均值,且排除大型模型作為評審。 安全子集實施了五層反作弊機制:禁用字面掃描、重命名輸入、遮蔽遭篡改的測試、編碼依賴關係,以及使用權重較低的誘餌任務。 其中包含 38 項紅隊任務與 22 項藍隊任務,白盒審計則以 binutils、curl 及 nginx 中真實存在的 CVE 為依據。

任務建立遵循標準化流程:來源資料蒐集、重寫為真實請求、工作區組裝、執行後隔離評估資產,以及打包至獨立目錄。用戶資料在整個過程中均保持不變。程式碼任務分配五種不同角色(開發人員、演算法工程師、產品經理、品質保證、運維),而安全任務則分配專業角色。 系統會刻意提供不完整資訊——隱藏目標檔案、模式及邊界——迫使執行者必須獨立檢索上下文。計分資產僅在執行完成後才會揭露,確保執行者在操作過程中絕不會接觸到這些資產。

評估在隔離的容器中進行,模型與沙盒環境相互分離。該框架採用 CodeBuddy Code(預設)及 Claude Code,運用更強的推理能力與 20 萬字元上下文視窗,同時停用 WebSearch 和 AskUserQuestion 功能。此限制至關重要:停用線上搜尋可驗證抗污染機制是否如預期般運作。

排行榜對多個模型家族進行排名(分數範圍 0–100,思考模式,三項平均值)。Claude Opus4.8 在程式碼、網路、辦公室及安全等領域包辦前幾名,共奪得五項第一名;GLM-5.2 領先兩個安全類別,而 GPT-5.5 則在辦公室 cc 類別中名列前茅。 該框架展現出高敏感度,特別是在安全領域,平均絕對排名變化高達 8.6 分。在 cc 框架下,Claude Opus4.8 駁回了 13 個答案,相較之下,GPT-5.5 在 cbc 框架下僅駁回了 2 個答案。 就效率而言,GPT-5.5 在維持具競爭力的分數的同時,生成的標記數量最少;而 DeepSeek-V4-Pro 則以高標記吞吐量執行了 44 輪程式碼生成,反映出其採用了更耗資源的處理方式。

相關文章
Slackbot 成為 AI 智慧體 Slackbot 成為 AI 智慧體 Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6% 位元組跳動加大核心AI激勵,豆包增長14.6% 位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
MiniMax 推出 10 倍團隊計劃,以激勵全球 AI 專家 MiniMax 推出 10 倍團隊計劃,以激勵全球 AI 專家 MiniMax(稀宇科技)通用人工智慧實驗室正式推出“10x Team”,這是一項全球人才協作計劃。該計劃旨在招募跨行業的頂尖專家,探索大模型在垂直領域的深度應用。透過將深厚的行業知識與前沿人工智慧技術相結合,MiniMax 致力於將大模型的生產力從通用場景拓展至專業場景,最終推動行業效率實現“十倍增長”。驗證行業認知價值,開放多模態核心資源過去與行業專家的合作表明,深厚的專業洞察對於構建高質量、實用的行業專屬大模型至關重要。在此基礎上,“10x Team”計劃將向合作伙伴開放包括多模態模型
相關專題推薦
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
教育與學習 面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺
面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺

2026年最新最佳AI測驗構建平臺,適用於教師、輔導老師和基於群體的學習專案!XIX.AI精心整理了一份頂級評分列表,包含經過現實世界測試的強力變革性工具,以提供準確的排名。這些必試平臺有助於提高寫作效率、簡化內容創作,並簡化各種學習場景中的測驗設計。立即探索,發現您解鎖教學AI優勢的理想工具!

13 個工具
xix.ai
評論 (0)
0/500
OR