具身智能“高考”難瘋了,人類100分,最強模型12.8

2026年7月8日 19:44
具身智能“高考”難瘋了,人類100分,最強模型12.8

重點摘要

一項被稱為「具身智能高考」的評測結果顯示,人類輕鬆獲得滿分100分,但表現最好的AI模型僅拿下12.8分,差距懸殊。這項測試模擬真實環境挑戰,凸顯了當前行業在物理常識與動態適應能力上的瓶頸。

站內 AI 整理稿

一場被稱為「具身智能高考」的評測近期在科技圈引發熱議,結果顯示人類與當前最先進的AI模型之間存在巨大鴻溝。人類參與者在這項針對機器人與環境互動能力的測試中,能夠輕鬆拿下滿分100分,然而表現最好的AI模型僅獲得12.8分,差距極為懸殊。這場「考試」幾乎讓所有現階段的具身智能模型都「考砸了」,凸顯出該領域在真實世界認知與動態適應上的顯著瓶頸。所謂具身智能(Embodied Intelligence),指的是具備在物理世界中感知、推理並執行操作能力的AI系統,最常見的應用載體便是自主機器人。

與單純處理文字或圖像的語言模型不同,具身智能系統必須同時處理視覺、觸覺、運動控制等多模態資訊,並在開放且不可預測的真實環境中做出即時決策。這對模型的綜合能力提出了極高要求,也使得評測的設計格外具有挑戰性。據了解,這項評測的題目模擬了真實環境中的各種挑戰,從簡單的物體抓取與放置,到需要多步驟規劃的移動與操作任務。人類可以憑藉直覺與經驗輕鬆應對,例如判斷一張桌子是否能承受重物、在狹窄空間內避開障礙物,或根據場景變化調整動作順序。然而對於當前AI模型而言,理解場景語義、規劃合理動作序列,並適應隨機出現的干擾因素,依然是極難跨越的門檻。12.8分的成績雖然看似微不足道,但其實已經是當前最先進水平。

這背後反映出一個核心問題:即便AI在特定受控環境(例如工廠產線或實驗室平台)中已能展現出驚人能力,一旦脫離這些邊界條件,面對開放式場景中的「物理常識」與「動態變化」,模型便容易失靈。例如,一個能精準抓取同款杯子的機械臂,若杯子被移動到不同位置、或被輕微遮擋,其成功率就會大幅下降。專家分析指出,這場「高考」突顯了具身智能當前的兩大瓶頸:一是對物理世界常識的理解不足,例如無法判斷物體的材質、重心或摩擦力,導致夾取力度不當;二是動態適應能力薄弱,無法像人類一樣在行動中隨時調整策略,而是依賴固定的規劃路徑。這些瓶頸使得機器人在面對家庭、醫療或救援等非結構化環境時,表現往往遠遠不如預期。

值得注意的是,評測中的「人類100分」並非誇張表述,而是經過標準化設計的基準。人類參與者只需按照日常邏輯完成任務,例如開門、推車、疊毛巾等,便能輕鬆滿分。而AI模型則需要在未知環境中,僅依靠感測器數據和內部演算法,自行完成從感知到執行的閉環。目前多數模型在單一環節已能達到不錯水準,但在全鏈路整合上仍存在嚴重斷裂。即便如此,這場評測並非唱衰具身智能,而是為整個行業提供了一個極為明確的進步標尺。過去,各家團隊往往使用自訂的環境與任務進行對比,難以橫向比較真實能力。透過這種統一且與人類表現直接掛鉤的測試,研究人員能夠更清楚知道自己的模型在哪裡卡關,從而集中資源突破關鍵技術節點。

事實上,近兩年全球主要AI實驗室與機器人公司都已將具身智能視為下一波重要賽道。從Google的RT系列到特斯拉的Optimus,再到中國本土多家新創團隊,無不投入大量資源提升機器人在真實世界的泛化能力。然而這場「高考」結果清楚表明,理論框架雖然進展迅速,實際落地距離人類水準仍有非常遙遠的距離。不少業內人士認為,未來幾年的關鍵突破點可能在於「模擬到真實的遷移能力」。目前許多模型是在高保真模擬器中訓練的,但模擬與真實世界之間始終存在「細節鴻溝」。如何讓模型在實際場景中依然保持穩定表現,已成為研究熱點。此外,強化學習與大模型結合也被視為可能路徑,透過大量試錯讓機器人學會類人的感知與決策。從12.

8分到100分,看似是一道無法跨越的鴻溝,但也正因為基準如此清晰,後續的每一次進步都將極具說服力。可以預見,未來將有更多團隊以這場「高考」作為衡量自身技術水平的標準,並持續縮小機器與人類在真實世界認知上的差距。雖然現階段的成績難看,但這正是推動產業突破的必要過程。對於大眾而言,這場評測也提供了一面鏡子:AI在語言與圖像領域的飛速進步,容易讓人對機器人能力產生過度期待。事實上,要在真實世界中像人類一樣靈活行動,遠比寫詩、畫圖或回答問題來得困難。具身智能的「高考」才剛剛開始,而人類依然在絕大多數任務上擁有壓倒性優勢。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

5 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

7 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

11 小時前