騰訊推出 WorkBuddy Bench:一個整合程式碼、網頁、Office 及資安功能的程式設計智慧代理測試平台
從歷史上看,編碼代理程式一直局限於狹窄的領域——例如 SWE-bench 上的錯誤修正,或 Design2Code 上的前端任務——而生產環境的基準測試則大多無法供外部審查。 騰訊透過「WorkBuddy Bench」彌補了這項缺口,這是一套多領域評估套件,其詳情已於近期發表於 arXiv 的論文中闡述。其核心特點不在於任務數量,而在於其專門設計的架構,旨在明確防止系統背誦答案。
此基準測試涵蓋四大專業領域:軟體工程(儲存庫層級程式碼)、前端開發(網頁產出物)、業務營運(多檔案辦公室工作流程)以及網路安全(紅隊與藍隊情境)。 該套件分別包含 80、70、50 及 60 項任務,總計 260 項。 關鍵在於,所有任務均非源自公開題庫;而是透過逆向工程從真實的程式碼提交、拉取請求或商業情境中萃取,並重新表述為簡潔、口語化且具角色扮演性質的提示。 此方法確保透過線上搜尋對應的拉取請求或提交線索均無法獲得結果,從而有效防止死記硬背。由於資料集完全公開——包括目錄、環境映像、評估工具、測試案例及參考解法——其抗污染能力仰賴於此建構方法與版本控制,而非依賴隱蔽性。

雖然這四個子集均採用統一的目錄結構,但各自採用不同的驗證指標,因此子集之間的直接分數比較並不具參考價值。 因此,騰訊並未公布綜合套件分數。程式碼任務透過隱藏的測試通過率進行評估;網頁任務則結合規則檢查與大型語言模型(LLM)/大型視覺模型(VLM)及代理程式評估,要求參賽者在無實時網路連線的情況下,沿指定路徑提交成果; 辦公室任務採用權重介於 0.70–0.95 之間的確定性規則檢查,並結合基於證據的 LLM 評估;而安全任務則仰賴確定性 scoring.py 腳本,執行三次並取平均值,且排除大型模型作為評審。 安全子集實施了五層反作弊機制:禁用字面掃描、重命名輸入、遮蔽遭篡改的測試、編碼依賴關係,以及使用權重較低的誘餌任務。 其中包含 38 項紅隊任務與 22 項藍隊任務,白盒審計則以 binutils、curl 及 nginx 中真實存在的 CVE 為依據。
任務建立遵循標準化流程:來源資料蒐集、重寫為真實請求、工作區組裝、執行後隔離評估資產,以及打包至獨立目錄。用戶資料在整個過程中均保持不變。程式碼任務分配五種不同角色(開發人員、演算法工程師、產品經理、品質保證、運維),而安全任務則分配專業角色。 系統會刻意提供不完整資訊——隱藏目標檔案、模式及邊界——迫使執行者必須獨立檢索上下文。計分資產僅在執行完成後才會揭露,確保執行者在操作過程中絕不會接觸到這些資產。
評估在隔離的容器中進行,模型與沙盒環境相互分離。該框架採用 CodeBuddy Code(預設)及 Claude Code,運用更強的推理能力與 20 萬字元上下文視窗,同時停用 WebSearch 和 AskUserQuestion 功能。此限制至關重要:停用線上搜尋可驗證抗污染機制是否如預期般運作。
排行榜對多個模型家族進行排名(分數範圍 0–100,思考模式,三項平均值)。Claude Opus4.8 在程式碼、網路、辦公室及安全等領域包辦前幾名,共奪得五項第一名;GLM-5.2 領先兩個安全類別,而 GPT-5.5 則在辦公室 cc 類別中名列前茅。 該框架展現出高敏感度,特別是在安全領域,平均絕對排名變化高達 8.6 分。在 cc 框架下,Claude Opus4.8 駁回了 13 個答案,相較之下,GPT-5.5 在 cbc 框架下僅駁回了 2 個答案。 就效率而言,GPT-5.5 在維持具競爭力的分數的同時,生成的標記數量最少;而 DeepSeek-V4-Pro 則以高標記吞吐量執行了 44 輪程式碼生成,反映出其採用了更耗資源的處理方式。
相關文章
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
MiniMax 推出 10 倍團隊計劃,以激勵全球 AI 專家
MiniMax(稀宇科技)通用人工智慧實驗室正式推出“10x Team”,這是一項全球人才協作計劃。該計劃旨在招募跨行業的頂尖專家,探索大模型在垂直領域的深度應用。透過將深厚的行業知識與前沿人工智慧技術相結合,MiniMax 致力於將大模型的生產力從通用場景拓展至專業場景,最終推動行業效率實現“十倍增長”。驗證行業認知價值,開放多模態核心資源過去與行業專家的合作表明,深厚的專業洞察對於構建高質量、實用的行業專屬大模型至關重要。在此基礎上,“10x Team”計劃將向合作伙伴開放包括多模態模型
相關專題推薦
評論 (0)
0/500
從歷史上看,編碼代理程式一直局限於狹窄的領域——例如 SWE-bench 上的錯誤修正,或 Design2Code 上的前端任務——而生產環境的基準測試則大多無法供外部審查。 騰訊透過「WorkBuddy Bench」彌補了這項缺口,這是一套多領域評估套件,其詳情已於近期發表於 arXiv 的論文中闡述。其核心特點不在於任務數量,而在於其專門設計的架構,旨在明確防止系統背誦答案。
此基準測試涵蓋四大專業領域:軟體工程(儲存庫層級程式碼)、前端開發(網頁產出物)、業務營運(多檔案辦公室工作流程)以及網路安全(紅隊與藍隊情境)。 該套件分別包含 80、70、50 及 60 項任務,總計 260 項。 關鍵在於,所有任務均非源自公開題庫;而是透過逆向工程從真實的程式碼提交、拉取請求或商業情境中萃取,並重新表述為簡潔、口語化且具角色扮演性質的提示。 此方法確保透過線上搜尋對應的拉取請求或提交線索均無法獲得結果,從而有效防止死記硬背。由於資料集完全公開——包括目錄、環境映像、評估工具、測試案例及參考解法——其抗污染能力仰賴於此建構方法與版本控制,而非依賴隱蔽性。

雖然這四個子集均採用統一的目錄結構,但各自採用不同的驗證指標,因此子集之間的直接分數比較並不具參考價值。 因此,騰訊並未公布綜合套件分數。程式碼任務透過隱藏的測試通過率進行評估;網頁任務則結合規則檢查與大型語言模型(LLM)/大型視覺模型(VLM)及代理程式評估,要求參賽者在無實時網路連線的情況下,沿指定路徑提交成果; 辦公室任務採用權重介於 0.70–0.95 之間的確定性規則檢查,並結合基於證據的 LLM 評估;而安全任務則仰賴確定性 scoring.py 腳本,執行三次並取平均值,且排除大型模型作為評審。 安全子集實施了五層反作弊機制:禁用字面掃描、重命名輸入、遮蔽遭篡改的測試、編碼依賴關係,以及使用權重較低的誘餌任務。 其中包含 38 項紅隊任務與 22 項藍隊任務,白盒審計則以 binutils、curl 及 nginx 中真實存在的 CVE 為依據。
任務建立遵循標準化流程:來源資料蒐集、重寫為真實請求、工作區組裝、執行後隔離評估資產,以及打包至獨立目錄。用戶資料在整個過程中均保持不變。程式碼任務分配五種不同角色(開發人員、演算法工程師、產品經理、品質保證、運維),而安全任務則分配專業角色。 系統會刻意提供不完整資訊——隱藏目標檔案、模式及邊界——迫使執行者必須獨立檢索上下文。計分資產僅在執行完成後才會揭露,確保執行者在操作過程中絕不會接觸到這些資產。
評估在隔離的容器中進行,模型與沙盒環境相互分離。該框架採用 CodeBuddy Code(預設)及 Claude Code,運用更強的推理能力與 20 萬字元上下文視窗,同時停用 WebSearch 和 AskUserQuestion 功能。此限制至關重要:停用線上搜尋可驗證抗污染機制是否如預期般運作。
排行榜對多個模型家族進行排名(分數範圍 0–100,思考模式,三項平均值)。Claude Opus4.8 在程式碼、網路、辦公室及安全等領域包辦前幾名,共奪得五項第一名;GLM-5.2 領先兩個安全類別,而 GPT-5.5 則在辦公室 cc 類別中名列前茅。 該框架展現出高敏感度,特別是在安全領域,平均絕對排名變化高達 8.6 分。在 cc 框架下,Claude Opus4.8 駁回了 13 個答案,相較之下,GPT-5.5 在 cbc 框架下僅駁回了 2 個答案。 就效率而言,GPT-5.5 在維持具競爭力的分數的同時,生成的標記數量最少;而 DeepSeek-V4-Pro 則以高標記吞吐量執行了 44 輪程式碼生成,反映出其採用了更耗資源的處理方式。
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
MiniMax 推出 10 倍團隊計劃,以激勵全球 AI 專家
MiniMax(稀宇科技)通用人工智慧實驗室正式推出“10x Team”,這是一項全球人才協作計劃。該計劃旨在招募跨行業的頂尖專家,探索大模型在垂直領域的深度應用。透過將深厚的行業知識與前沿人工智慧技術相結合,MiniMax 致力於將大模型的生產力從通用場景拓展至專業場景,最終推動行業效率實現“十倍增長”。驗證行業認知價值,開放多模態核心資源過去與行業專家的合作表明,深厚的專業洞察對於構建高質量、實用的行業專屬大模型至關重要。在此基礎上,“10x Team”計劃將向合作伙伴開放包括多模態模型





首頁






