雷峰網AI Agent

百度文心助手任務 Agent 登頂國際權威榜單,超越 Claude、GPT 拿下全球智能體冠軍

2026年7月22日 07:18

重點摘要

2026 年 7 月 17 日,百度文心助手任務 Agent,以最高分 94.6%、平均分 94.4% 的成績,登頂全球工程向 AI 智能體評測榜單 PinchBench v2。成為首個以正式產品身份獲得 PinchBench 總榜第一的國產智能體系統。 在 59 個參評模型中,文心助手任務 Agent 排名第一,領先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通義千問 Qwen3.

站內 AI 整理稿

2026年7月17日,百度文心助手任務Agent以94.4%的最高分,在全球工程向AI智能體評測榜單PinchBench v2中奪冠,超越Anthropic Claude Opus與GPT系列模型,成為首個以正式產品身份拿下該榜單總榜第一的國產智能體系統。這項成績不僅標誌著百度在AI智能體領域的技術突破,也反映出業界對智能體「能否完成真實任務」的評估標準正在發生轉變。 PinchBench v2由Kilo AI推出、OpenClaw社區維護,與傳統大模型基準如MMLU、GPQA有本質不同。傳統基準測試的是「模型知不知道」,而PinchBench考驗的是「智能體能否把整件事做完,並交付可驗證的結果」。這種測試方向更貼近實際應用場景,也讓評測結果具有更高的參考價值。該榜單目前包含23個真實工作場景、147項任務,覆蓋數據分析、研究寫作、代碼開發、辦公自動化、文檔處理、網頁操作與多媒體處理七大類別,總共完成617次測試運行。評分機制採用「自動化校驗+LLM評審」的雙軌模式,全程零人工干預,確保結果客觀且可重複。 在59個參評模型中,百度文心助手任務Agent以94.4%的成績排名第一,領先第二名Anthropic Claude Opus約4.5個百分點。這項差距在PinchBench的嚴格評分標準下相當顯著,因為榜單測試的不是單一知識問答,而是多步驟、跨工具、需交付具體成果的複雜任務鏈。百度文心助手能在這些真實場景中穩定勝出,顯示其任務規劃、工具調用與結果驗證能力已達到國際領先水準。 百度文心助手任務Agent的核心優勢在於其「任務導向」的設計哲學。不同於一般對話式AI僅回應單一問題,它能夠將使用者提出的模糊目標拆解為可執行的子任務,自動調用瀏覽器、文檔編輯器、程式碼執行環境、數據庫等工具,並在過程中即時修正錯誤,最終產出可被驗證的成果。例如,在數據分析任務中,Agent能自動爬取資料、清洗數據、繪製圖表並撰寫分析報告;在研究寫作任務中,它能蒐集文獻、整理摘要、生成初稿並按格式排版。這種「從頭到尾交付結果」的能力,正是PinchBench v2特別強調的測試重點。 值得注意的是,文心助手任務Agent是以「正式產品」而非實驗室模型的身分參賽並奪冠。這在PinchBench歷史上尚屬首次,代表該系統已經過大規模用戶考驗,具備穩定性與實用性。百度在AI領域長期投入,從文心大模型到文心助手,逐步將技術能力落地為可用的產品。此次成績不僅是技術層面的肯定,也為百度在企業級AI應用市場建立了一個重要里程碑。 Anthropic Claude Opus與GPT系列在PinchBench v2中分別位居第二及後續名次,但百度文心助手任務Agent的領先幅度並非僥倖。PinchBench的雙軌評分機制,要求智能體不僅要完成任務,還必須產出「可被自動化工具或LLM評審正確驗證的結果」,這讓作弊或取巧變得極其困難。例如,在代碼開發任務中,系統必須寫出能通過單元測試的程式碼;在網頁操作任務中,必須實際點擊、填表並提交表單,而非僅模擬。這種設計讓榜單排名具有極高的可信度。 百度文心助手任務Agent的奪冠,也反映出中國AI公司在智能體賽道上的快速進步。過去幾年,國際評測榜單常由歐美公司主導,但PinchBench v2的結果顯示,中國產品的工程能力與場景化落地能力已達到世界一流水準。百度在搜尋、地圖、自動駕駛等領域積累的技術,為文心助手提供了豐富的工具生態與數據基礎,使其在真實任務中展現出更高的成功率。 業界分析認為,智能體將是AI下一階段的核心競爭領域。傳統大模型在知識問答、文本生成上已相當成熟,但真正能取代人類完成複雜工作流程的產品仍是少數。PinchBench v2的出現,正是為了填補這個評測空白。百度文心助手任務Agent的成績,不僅為自身產品背書,也為整個行業提供了一個可參考的標竿。 展望未來,百度預計將持續優化文心助手的任務規劃能力,拓展更多行業場景,並進一步降低使用者門檻。隨著PinchBench等榜單的影響力擴大,智能體產品之間的競爭將更加激烈,而百度以正式產品身分取得第一,無疑為其後續發展奠定了堅實信心。

Related

相關文章

大廠肉搏WAIC:阿里、騰訊當面對擂,智能體入口卡位戰全線開打

在今年的世界人工智能大會(WAIC)上,中國科技巨頭之間的競爭進一步白熱化,阿里巴巴與騰訊兩大陣營直接對壘,將智能體(AI Agent)視為下一階段爭奪的核心入口。會場內外,雙方不僅展示各自的模型能力,更把焦點放在如何讓AI從「被動回答」進化為「主動執行任務」的智能體應用上,意圖搶佔用戶與企業服務的第一道關卡。 這場智能體入口卡位戰的背後,本質上是一場關於「自主進化」能力的競賽。

剛剛

AI PC過時了,AC一夜爆發,Agent真的需要專屬電腦?

AMD提出Agent Computer(AC)概念,專為AI Agent長期運行設計,主打始終在線、始終可用。多家廠商在WAIC展示相關產品,但AC對普通用戶需求有限,更適合開發者與內容團隊。AC與PC將共存,不會全面取代傳統個人電腦。

34 分鐘前

我在WAIC 2026看見的十大趨勢

WAIC 2026 展現出 AI 從展示轉向實用,智能體(Agent)成為主流,能完成具體任務才是關鍵。基座模型競爭進入半決賽,各家策略明顯分化;世界模型與具身智能成為新焦點,機器人開始在真實場景中實際工作。

34 分鐘前