量子位AI Agent

百度文心助手任務Agent登頂國際權威榜單,超越Claude、GPT拿下全球智能體冠軍

2026年7月22日 15:39
百度文心助手任務Agent登頂國際權威榜單,超越Claude、GPT拿下全球智能體冠軍

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

站內 AI 整理稿

百度文心助手任務Agent近日在國際權威的工程向AI智能體評測榜單PinchBench v2中,以94.4%的最高分一舉奪冠,正式超越包括Anthropic Claude Opus在內的多款國際頂尖模型,成為首個以正式產品身份獲得該榜單總榜第一的國產智能體系統。這項成績不僅刷新了中國AI在智能體領域的國際紀錄,也再次驗證了百度在任務型智能體技術上的深厚積累。根據評測結果,在總計59個參評模型中,百度文心助手任務Agent以94.4%的成績穩居榜首,領先Anthropic Claude Opus約4.5個百分點。

這項評測涵蓋了來自全球各大AI實驗室與企業的智能體系統,包括OpenAI、Anthropic、Google等公司的最新產品,競爭可謂相當激烈。百度文心助手任務Agent能夠脫穎而出,代表其在任務理解、執行流程、結果交付等關鍵環節展現出明顯優勢。PinchBench v2由Kilo AI推出,並由OpenClaw社區維護,與傳統的大型語言模型基準測試有著本質不同。傳統的MMLU、GPQA等基準主要評估模型「知不知道」某個知識點,即模型對事實性問題的回答準確度;而PinchBench的核心在於評估智能體「能不能把整件事做完並交付可驗證的結果」。

這意味著,評測不僅關注模型是否理解指令,更關注它能否在真實或模擬的工程場景中,自主完成一系列連貫的任務,最終產出可以被客觀檢查的成果。這種「任務導向」的評測設計,使得PinchBench成為衡量智能體實用性的重要標尺。許多模型在傳統知識問答中表現優異,但在實際工程任務中卻因無法正確規劃步驟、無法調用工具或無法處理錯誤而失敗。百度文心助手任務Agent能夠在PinchBench v2中奪冠,說明它在任務拆解、工具調用、狀態追蹤與結果驗證等智能體核心能力上具備領先水平。作為百度在AI領域的重要產品,文心助手任務Agent整合了文心大模型的語言理解與生成能力,並針對任務執行場景進行了深度優化。

它能夠根據用戶的自然語言指令,自動規劃執行路徑,調用百度生態內外的各類工具,如搜尋、地圖、文檔處理、數據分析等,並在執行過程中不斷回饋進度,最終產出結構化的結果。這種「從指令到交付」的閉環能力,正是其在PinchBench評測中勝出的關鍵。此次奪冠也反映出中國AI產業在智能體賽道上的快速進步。過去,國際榜單往往由海外技術巨頭主導,國產系統較難在這種高難度工程評測中取得領先。百度文心助手任務Agent以正式產品身份登頂,意味著國產智能體不僅在實驗室環境中表現出色,更已經具備穩定可靠的商用能力,能夠在全球範圍內與一流產品同台競爭。業內人士指出,智能體是AI從「對話」走向「行動」的關鍵一步。

隨著大模型技術的成熟,如何讓AI真正「做事」而非僅僅「說話」,已成為行業關注的焦點。PinchBench這類評測的出現,正好填補了傳統基準對執行能力評估不足的空缺。百度在該榜單上的成績,也為其他開發者與企業提供了重要參考:未來的AI競爭,將更多聚焦於任務執行力與結果交付能力。百度方面表示,文心助手任務Agent將持續迭代,進一步提升在複雜工程場景中的自主規劃與執行能力。同時,百度也將把這項技術開放給更多開發者與企業用戶,推動智能體在辦公自動化、客戶服務、數據分析、代碼開發等領域的實際落地。

可以預見,隨著PinchBench等評測標準的普及,智能體技術的發展將更加透明化、實用化,而百度文心助手任務Agent的這次登頂,無疑為整個行業樹立了一個新的標竿。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

3 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

9 小時前