雷峰網AI Agent

百度文心助手任務 Agent 登頂國際權威榜單,超越 Claude、GPT 拿下全球智能體冠軍

2026年7月22日 07:18

重點摘要

2026 年 7 月 17 日,百度文心助手任務 Agent,以最高分 94.6%、平均分 94.4% 的成績,登頂全球工程向 AI 智能體評測榜單 PinchBench v2。成為首個以正式產品身份獲得 PinchBench 總榜第一的國產智能體系統。 在 59 個參評模型中,文心助手任務 Agent 排名第一,領先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通義千問 Qwen3.

站內 AI 整理稿

2026年7月17日,百度文心助手任務Agent以94.4%的最高分,在全球工程向AI智能體評測榜單PinchBench v2中奪冠,超越Anthropic Claude Opus與GPT系列模型,成為首個以正式產品身份拿下該榜單總榜第一的國產智能體系統。這項成績不僅標誌著百度在AI智能體領域的技術突破,也反映出業界對智能體「能否完成真實任務」的評估標準正在發生轉變。PinchBench v2由Kilo AI推出、OpenClaw社區維護,與傳統大模型基準如MMLU、GPQA有本質不同。

傳統基準測試的是「模型知不知道」,而PinchBench考驗的是「智能體能否把整件事做完,並交付可驗證的結果」。這種測試方向更貼近實際應用場景,也讓評測結果具有更高的參考價值。該榜單目前包含23個真實工作場景、147項任務,覆蓋數據分析、研究寫作、代碼開發、辦公自動化、文檔處理、網頁操作與多媒體處理七大類別,總共完成617次測試運行。評分機制採用「自動化校驗+LLM評審」的雙軌模式,全程零人工干預,確保結果客觀且可重複。在59個參評模型中,百度文心助手任務Agent以94.4%的成績排名第一,領先第二名Anthropic Claude Opus約4.5個百分點。

這項差距在PinchBench的嚴格評分標準下相當顯著,因為榜單測試的不是單一知識問答,而是多步驟、跨工具、需交付具體成果的複雜任務鏈。百度文心助手能在這些真實場景中穩定勝出,顯示其任務規劃、工具調用與結果驗證能力已達到國際領先水準。百度文心助手任務Agent的核心優勢在於其「任務導向」的設計哲學。不同於一般對話式AI僅回應單一問題,它能夠將使用者提出的模糊目標拆解為可執行的子任務,自動調用瀏覽器、文檔編輯器、程式碼執行環境、數據庫等工具,並在過程中即時修正錯誤,最終產出可被驗證的成果。

例如,在數據分析任務中,Agent能自動爬取資料、清洗數據、繪製圖表並撰寫分析報告;在研究寫作任務中,它能蒐集文獻、整理摘要、生成初稿並按格式排版。這種「從頭到尾交付結果」的能力,正是PinchBench v2特別強調的測試重點。值得注意的是,文心助手任務Agent是以「正式產品」而非實驗室模型的身分參賽並奪冠。這在PinchBench歷史上尚屬首次,代表該系統已經過大規模用戶考驗,具備穩定性與實用性。百度在AI領域長期投入,從文心大模型到文心助手,逐步將技術能力落地為可用的產品。此次成績不僅是技術層面的肯定,也為百度在企業級AI應用市場建立了一個重要里程碑。

Anthropic Claude Opus與GPT系列在PinchBench v2中分別位居第二及後續名次,但百度文心助手任務Agent的領先幅度並非僥倖。PinchBench的雙軌評分機制,要求智能體不僅要完成任務,還必須產出「可被自動化工具或LLM評審正確驗證的結果」,這讓作弊或取巧變得極其困難。例如,在代碼開發任務中,系統必須寫出能通過單元測試的程式碼;在網頁操作任務中,必須實際點擊、填表並提交表單,而非僅模擬。這種設計讓榜單排名具有極高的可信度。百度文心助手任務Agent的奪冠,也反映出中國AI公司在智能體賽道上的快速進步。

過去幾年,國際評測榜單常由歐美公司主導,但PinchBench v2的結果顯示,中國產品的工程能力與場景化落地能力已達到世界一流水準。百度在搜尋、地圖、自動駕駛等領域積累的技術,為文心助手提供了豐富的工具生態與數據基礎,使其在真實任務中展現出更高的成功率。業界分析認為,智能體將是AI下一階段的核心競爭領域。傳統大模型在知識問答、文本生成上已相當成熟,但真正能取代人類完成複雜工作流程的產品仍是少數。PinchBench v2的出現,正是為了填補這個評測空白。百度文心助手任務Agent的成績,不僅為自身產品背書,也為整個行業提供了一個可參考的標竿。

展望未來,百度預計將持續優化文心助手的任務規劃能力,拓展更多行業場景,並進一步降低使用者門檻。隨著PinchBench等榜單的影響力擴大,智能體產品之間的競爭將更加激烈,而百度以正式產品身分取得第一,無疑為其後續發展奠定了堅實信心。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

1 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

6 小時前