騰訊甩出 WorkBuddy Bench:一套把代碼、網頁、辦公、安全全裝進來的編碼智能體考場

2026年7月24日 06:026200 次瀏覽

重點摘要

AI資訊AI新閒資訊正文騰訊甩出 WorkBuddy Bench:一套把代碼、網頁、辦公、安全全裝進來的編碼智能體考場發布於AI新閒資訊時間 :Jul 24, 2026閱讀 :1分鐘評測編碼智能體,過去總在幾塊割裂的場子裡打轉——修 bug 的看 SWE-bench,做前端的看 Design2Code,生產環境的基準又多半關著門不讓外人審計。

站內 AI 整理稿

騰訊近日在 arXiv 上發表論文,正式推出名為 WorkBuddy Bench 的多領域編碼智能體評測套件。這套基準的設計初衷,正是為了解決當前編碼智能體評測領域長期存在的碎片化問題:過去,修補程式碼錯誤的模型只能在 SWE-bench 上測試,前端生成能力則依賴 Design2Code 這類單一任務集,而真正貼近生產環境的評測通常不對外公開,外界難以審計與比較。騰訊這次將四個原本各自為政的領域整合到同一個框架之下,讓評測不再只是單點能力的檢驗。

WorkBuddy Bench 涵蓋程式碼、網頁、辦公與安全四大工作場景,分別對應倉庫級的軟體工程、前端製品生成、多文件流程業務處理,以及紅藍隊攻防演練。每個領域的任務數量分別為 80、70、50 與 60 道,總計 260 道題目。這批題目並非從現有公開題庫中改編,而是從真實的程式碼提交、拉取請求或業務場景中「逆向工程」萃取出來,再經過重新改寫,變成簡短、口語化且帶有角色扮演味道的提示詞。這種構造方式的最大優勢在於抗汙染。由於每個任務的提示詞無法透過簡單的網路搜尋對應到原始的 PR 或提交記錄,智能體無法靠「背答案」來取得高分。

騰訊同時公開了整個數據集,包含任務目錄、環境鏡像、評估工具、測試用例與參考方案,讓研究社群可以完整複現與驗證。然而,為了避免數據集被汙染,團隊並非採用封閉題庫的手法,而是依賴上述的逆向工程與版本管理機制來確保公平性。值得注意的是,四個子集雖然共享同一套任務目錄格式,但各自的驗證方式並不相同。這意味著不同領域的分數無法直接比較,因此騰訊在論文中刻意不提供套件的平均分數,避免誤導讀者或產生不當的跨領域排名。這種設計反映了團隊對評測嚴謹性的重視,也呼應了當前業界對於編碼智能體能力評估應該更加細緻、而非追求單一數字的主流觀點。

在程式碼領域,WorkBuddy Bench 的任務設計聚焦於倉庫級軟體工程,要求智能體理解整個專案結構、修改多個檔案並通過測試。網頁領域則著重前端生成,從 UI 實作到互動邏輯,必須產出可直接運行的 HTML/CSS/JavaScript 程式碼。辦公領域的任務模擬真實的多文件協作流程,例如合併報表、更新簡報或處理跨試算表的數據校驗。安全領域則以紅藍隊對抗為核心,測試智能體是否能發現漏洞、撰寫攻擊 payload 或修補弱點。每個領域的任務都經過精心設計,確保難度分布合理,且與實際工作場景高度貼合。

例如,辦公領域的提示詞可能描述一位使用者在多個 Excel 與 Word 檔案之間進行數據同步,要求智能體理解業務邏輯後自動完成操作。安全領域的任務則可能要求智能體扮演紅隊,從給定的原始碼中找出 SQL 注入點並寫出利用程式碼。這些任務不僅考驗編碼能力,更要求模型具備對上下文的理解與推理。騰訊在論文中也展示了 WorkBuddy Bench 的評測工具與環境架構。每個任務都提供預先配置好的 Docker 鏡像,確保評測環境一致,避免因環境差異導致結果失真。評估工具會自動比對智能體的輸出與參考方案,並根據該領域的標準回報通過率或分數。

由於數據集與工具全部公開,任何團隊都可以在自己的硬體上重複評測,甚至針對特定領域進行細化調整。這套基準的推出,補上了當前編碼智能體評測體系中一塊重要的拼圖。過去,業界雖然有 SWE-bench、Design2Code 等單一領域標竿,但缺乏一個能同時涵蓋多種工作場景、且具有抗汙染設計的統一平台。WorkBuddy Bench 的出現,讓開發者與研究人員可以更全面地評估自家模型的實際表現,尤其是在需要跨領域協作的複雜任務上。從技術角度來看,WorkBuddy Bench 的逆向工程構造方式值得關注。傳統的基準測試經常從開源專案中直接擷取問題,導致模型可以透過記憶訓練資料中的解法來刷分。

騰訊的做法是將真實場景中的需求轉換為高度抽象化的提示詞,並加入角色扮演元素,使題目無法被簡單搜尋比對。這種方法雖然增加了製作成本,但能有效提升評測的可信度。此外,騰訊選擇不報套件平均分,也反映了對評測結果的謹慎態度。由於四個領域的驗證方式與難度不同,強行計算加權平均可能掩蓋模型在各領域的真實能力差異。研究人員可以根據自身需求,專注於特定領域的成績,或進行細部分析。這種設計也避免了「刷平均分」的無意義競賽。對於開發編碼智能體的團隊而言,WorkBuddy Bench 提供了一個更具參考價值的測試場域。無論是專注於程式碼修復、前端生成、辦公自動化還是安全檢測,都能在對應的子集中找到合適的任務。

而由於數據集完全公開,團隊也可以將自己的評測結果與論文中的基線進行比較,甚至貢獻新的任務或修正。目前,WorkBuddy Bench 的論文與數據集已可在 arXiv 上取得,預計將吸引學術界與產業界的廣泛關注。隨著編碼智能體技術的快速演進,一套能夠真實反映模型在實際工作場景中表現的評測基準,將成為推動進步的重要基礎。騰訊這次的嘗試,或許會為後續的評測標準樹立一個新的方向。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

5 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

7 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

10 小時前