模型跑得快、評測跟不上?具身智能“本領”亟待統一“標尺”

多方上線具身智能評測平臺,行業加速探索統一標準 多方共建的常態化具身智能仿真評測平臺RoboColiseum正式上線,試圖為具身模型建立一套結果可信、過程可復現、且與真機表現高度一致的仿真評測體系。2026年過半,具身智能模型正在快速湧現。但模型數量的增長並未讓行業變得更清晰,恰恰相反,可選方案越多,橫向能力對標反而越缺乏統一參照。過去一年,國內外多家機構陸續發佈了具身基座模型和VLA(視覺-語言-動作模型),演示視頻中的抓取、放置、倒水、疊衣等操作愈加“絲滑”。然而,當前具身智能行業始終面臨一個現實困境:模型跑得快,評測跟不上。
模型的真實能力邊界在哪、短板集中在何處,全行業仍缺少一套系統、可信的衡量標尺。《科創板日報》記者獲悉,日前,高校、科研機構、開源社區、機器人企業和模型公司多方共建的常態化具身智能仿真評測平臺RoboColiseum正式上線,試圖為具身模型建立一套結果可信、過程可復現、且與真機表現高度一致的仿真評測體系。RoboColiseum項目負責人吳墨在接受《科創板日報》記者採訪時披露了兩項核心驗證數據:平臺仿真評測與實機部署的相關性達到89.5%,相同模型在仿真環境與真實世界中的評測差異小於10%。
這一結論並非憑空而來,吳墨介紹,團隊基於十幾個從簡單到複雜的評測任務,每個任務均在真機和仿真環境中各進行了50到100次對照實驗,最後通過線性擬合得出89.5%這一相關性。RoboColiseum平臺 Sim2Real實驗對比 與傳統評測以單一綜合成功率概括模型能力的方式不同,RoboColiseum圍繞不同能力維度設置多個任務集,考察模型在各個維度中的表現。據瞭解,RoboColiseum已上線指令跟隨、空間理解、擾動適應、通用操作4類能力子榜,以及78個高保真仿真評測任務、覆蓋3000 多個泛化的case。
“我們是基於考察機器人在真實世界中完成一系列任務,需要具備哪些不同維度的能力,最終總結出的4類能力子榜。”吳墨向記者解釋了這一設計邏輯,“這個評測維度會去考驗模型能否聽懂指令、能否理解空間世界、能否去抵抗真實世界的擾動,最後完成指令操作的相關任務。” 與此同時,平臺還對每項任務做了子步驟拆解,實現失敗原因可追溯。評測過程中,系統不僅判定任務最終成敗,還會全程記錄模型完成的步驟、失敗節點,以及在不同場景下的泛化表現。自內測以來,RoboColiseum已有海內外40多支隊伍在平臺開展模型訓練與評測。吳墨透露,泛化性、長程精細操作等是目前多數模型的短板,後續將補充相關評測維度更新至平臺。
事實上,試圖補上評測標準短板的並非只有 RoboColiseum。事實上,今年以來,從官方機構到企業,再到學術社區,多方力量正在加速規範具身智能評測標準。2026年6月1日,由工業和信息化部批准發佈的《YD/T 6770-2026 人工智能 關鍵基礎技術 具身智能基準測試方法》正式實施,為具身智能領域首份行業標準。據介紹,該標準規範了在仿真環境和真實環境下,開展具身智能基準測試的環境設置、任務庫構建、測試過程和指標計算方法。在行業標準落地的同時,多家企業也推出了評測平臺。
光輪智能在北京人工智能創新高地建設推進會上正式發佈RoboFinals,基於100項高難度任務構建標準化評測體系;Dexmal原力靈機與Hugging Face共同發起開放式基準測試平臺RoboChallenge,平臺累計執行的真機測試總量已突破4萬次。國際上,加州大學伯克利分校、斯坦福大學、英偉達等機構聯合發起國際公開性具身智能機器人策略評測平臺。該平臺採用分佈式、眾包的真實世界評估網絡,通過超過600次雙盲真實機器人評估對比驗證方法有效性。儘管各方力量加速入局,但具身智能評測領域距離形成像大模型領域MMLU、GSM8K那樣的統一基準,仍有很長的路要走。具身評測為何如此之難?
本質差異在於評測對象的屬性不同。大模型的評測以靜態的問答數據集為主,跑一遍就能對比得分。但具身模型的評測需在動態的物理世界中進行,難以壓縮成一組標準問答。真機測試雖是最可靠的方式,但成本極高,一臺人形機器人動輒幾十萬,還需配套測試場地、運維工程師與長期調試周期等。此外,仿真評測最大的痛點還在於Sim2Real gap(仿真到現實鴻溝)。光照變化、物體位置偏移、材質差異等現實因素,都可能讓一個在仿真測試中表現良好的模型,在實際部署時出現“水土不服”。吳墨同樣指出,具身行業對模型還沒有一個統一的、權威的評測榜單。
主要由於行業和模型發展太快,大部分評測基準推出後不再更新,無法跟上模型迭代的節奏;同時,仿真與真機之間的gap如果過大,評測結果也難以真實反映模型表現。具身智能正處於從實驗室演示邁向規模化落地的關鍵節點,評測體系作為產業發展的核心基礎設施,重要性正日益凸顯。從官方標準落地到多方平臺相繼入場,行業正在共識形成的路上加速探索,《科創板日報》將持續關注。
Related
相關文章

2026 世界機器人大會在京閉幕:首發新品 311 件,下一屆官宣 2027 年 8 月 18 日開幕
作者:汪淼 責編:汪淼 評論: 8 月 24 日消息,為期 5 天的 2026 世界機器人大會於 8 月 23 日在北京落下帷幕。

買場景、建團隊、借渠道,OpenAI如何做企業服務
17分鐘前為什麼海外市場成了影響泡泡瑪特價值的關鍵18分鐘前從高珠到大眾時尚,飾品行業迎來新變化2026-08-20閱讀更多內容,狠戳這裡查看AI測評豆包WorkBuddy千問選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇格局生變,新銳集體圍剿韓妝巨頭?

李澤湘投過的商業園林機器人完成數千萬融資,瞄準海外綠地智能運維|硬氪首發 |
李澤湘投資的商業園林機器人公司完成數千萬人民幣融資,目標鎖定海外綠地智能運維市場。該公司提供商業園林智能作業平台,強調可複製且能降低成本、提升效率的生產力方案。
曝Hugging Face擬出售,估值或達130億美元
Hugging Face尚未對出售消息作出正式回應。Hugging Face是全球最大的開源大語言模型和數據集託管平臺,被業內視為“AI領域的GitHub”。若此次以130億美元或更高的估值完成出售,Hugging Face的估值將在不到三年的時間內增長近三倍,反映出AI基礎設施平臺在行業中的戰略價值正在快速攀升。就在此次出售消息傳出前一個月,7月16日Hugging Face剛剛經歷了一場震驚業界的安全事件。OpenAI的AI模型在安全測試中“失控”,自主入侵了Hugging Face的生產基礎設施。

脫單也靠AI,“賽博媒婆”拿到1500萬元天使融資
吳維消費星球2026.08.24 12:08 · 來自四川全文5561字00:00 / 16:05AI是婚戀的良配嗎?文 | 吳維消費星球2026年的創投圈,有一條心照不宣的潛規則:BP裡寫上”AI”兩個字,融資路能少走一半。AI賣咖啡,AI看風水,AI算八字,AI陪失眠的年輕人聊天到天亮。
英偉達AI服務器曝將漲價超15% 內存成本飆升成核心推手
據彭博社消息,英偉達 已告知其部分最大客戶,搭載AI芯片的服務器價格將普遍上漲超過15%,主要原因是內存芯片成本急劇飆升。具體漲價幅度將取決於英偉達芯片的型號以及內存配置。英偉達方面對此尚未作出回應。據分析師預測,2026年第二季度傳統DRAM合約價格環比將上漲58%至63%,此前第一季度已飆升90%至95%。消息面上,英偉達將於8月26日公佈第二財季財報。業內人士認為,此次漲價將進一步推高AI數據中心的建設成本。