模型跑得快、評測跟不上?具身智能“本領”亟待統一“標尺”

多方上線具身智能評測平臺,行業加速探索統一標準 多方共建的常態化具身智能仿真評測平臺RoboColiseum正式上線,試圖為具身模型建立一套結果可信、過程可復現、且與真機表現高度一致的仿真評測體系。2026年過半,具身智能模型正在快速湧現。但模型數量的增長並未讓行業變得更清晰,恰恰相反,可選方案越多,橫向能力對標反而越缺乏統一參照。過去一年,國內外多家機構陸續發佈了具身基座模型和VLA(視覺-語言-動作模型),演示視頻中的抓取、放置、倒水、疊衣等操作愈加“絲滑”。然而,當前具身智能行業始終面臨一個現實困境:模型跑得快,評測跟不上。
模型的真實能力邊界在哪、短板集中在何處,全行業仍缺少一套系統、可信的衡量標尺。《科創板日報》記者獲悉,日前,高校、科研機構、開源社區、機器人企業和模型公司多方共建的常態化具身智能仿真評測平臺RoboColiseum正式上線,試圖為具身模型建立一套結果可信、過程可復現、且與真機表現高度一致的仿真評測體系。RoboColiseum項目負責人吳墨在接受《科創板日報》記者採訪時披露了兩項核心驗證數據:平臺仿真評測與實機部署的相關性達到89.5%,相同模型在仿真環境與真實世界中的評測差異小於10%。
這一結論並非憑空而來,吳墨介紹,團隊基於十幾個從簡單到複雜的評測任務,每個任務均在真機和仿真環境中各進行了50到100次對照實驗,最後通過線性擬合得出89.5%這一相關性。RoboColiseum平臺 Sim2Real實驗對比 與傳統評測以單一綜合成功率概括模型能力的方式不同,RoboColiseum圍繞不同能力維度設置多個任務集,考察模型在各個維度中的表現。據瞭解,RoboColiseum已上線指令跟隨、空間理解、擾動適應、通用操作4類能力子榜,以及78個高保真仿真評測任務、覆蓋3000 多個泛化的case。
“我們是基於考察機器人在真實世界中完成一系列任務,需要具備哪些不同維度的能力,最終總結出的4類能力子榜。”吳墨向記者解釋了這一設計邏輯,“這個評測維度會去考驗模型能否聽懂指令、能否理解空間世界、能否去抵抗真實世界的擾動,最後完成指令操作的相關任務。” 與此同時,平臺還對每項任務做了子步驟拆解,實現失敗原因可追溯。評測過程中,系統不僅判定任務最終成敗,還會全程記錄模型完成的步驟、失敗節點,以及在不同場景下的泛化表現。自內測以來,RoboColiseum已有海內外40多支隊伍在平臺開展模型訓練與評測。吳墨透露,泛化性、長程精細操作等是目前多數模型的短板,後續將補充相關評測維度更新至平臺。
事實上,試圖補上評測標準短板的並非只有 RoboColiseum。事實上,今年以來,從官方機構到企業,再到學術社區,多方力量正在加速規範具身智能評測標準。2026年6月1日,由工業和信息化部批准發佈的《YD/T 6770-2026 人工智能 關鍵基礎技術 具身智能基準測試方法》正式實施,為具身智能領域首份行業標準。據介紹,該標準規範了在仿真環境和真實環境下,開展具身智能基準測試的環境設置、任務庫構建、測試過程和指標計算方法。在行業標準落地的同時,多家企業也推出了評測平臺。
光輪智能在北京人工智能創新高地建設推進會上正式發佈RoboFinals,基於100項高難度任務構建標準化評測體系;Dexmal原力靈機與Hugging Face共同發起開放式基準測試平臺RoboChallenge,平臺累計執行的真機測試總量已突破4萬次。國際上,加州大學伯克利分校、斯坦福大學、英偉達等機構聯合發起國際公開性具身智能機器人策略評測平臺。該平臺採用分佈式、眾包的真實世界評估網絡,通過超過600次雙盲真實機器人評估對比驗證方法有效性。儘管各方力量加速入局,但具身智能評測領域距離形成像大模型領域MMLU、GSM8K那樣的統一基準,仍有很長的路要走。具身評測為何如此之難?
本質差異在於評測對象的屬性不同。大模型的評測以靜態的問答數據集為主,跑一遍就能對比得分。但具身模型的評測需在動態的物理世界中進行,難以壓縮成一組標準問答。真機測試雖是最可靠的方式,但成本極高,一臺人形機器人動輒幾十萬,還需配套測試場地、運維工程師與長期調試周期等。此外,仿真評測最大的痛點還在於Sim2Real gap(仿真到現實鴻溝)。光照變化、物體位置偏移、材質差異等現實因素,都可能讓一個在仿真測試中表現良好的模型,在實際部署時出現“水土不服”。吳墨同樣指出,具身行業對模型還沒有一個統一的、權威的評測榜單。
主要由於行業和模型發展太快,大部分評測基準推出後不再更新,無法跟上模型迭代的節奏;同時,仿真與真機之間的gap如果過大,評測結果也難以真實反映模型表現。具身智能正處於從實驗室演示邁向規模化落地的關鍵節點,評測體系作為產業發展的核心基礎設施,重要性正日益凸顯。從官方標準落地到多方平臺相繼入場,行業正在共識形成的路上加速探索,《科創板日報》將持續關注。
Related
相關文章

榮耀太想進步了
榮耀太想進步了,迴歸現實,榮耀仍面臨不少大考。 01 榮耀常閃耀在聚光燈下 今年的手機行業中,除了蘋果和華為的高關注度和高曝光度外,其次應該就屬榮耀了。 這幾天的2026世界機器人大會上,榮耀機器人再次閃耀登場,被多家媒體集中報道,成了熱搜話題。 在大會期間,8月23日,在第二屆世界人形機器人運動會400米賽跑大型組決賽中,榮耀機器人閃電以39.45秒的成績,再次打破人類紀錄。 相比於榮耀機器人的高曝光度,榮耀在傳統手機業務方面,前不久也剛剛放了大招,更值得關注。 榮耀8月12日正式發佈了榮耀Robot Phone,宣傳為全球首款機器人手機,話題熱度持續已久。 榮耀Robot Phone主打具身智能與機械雲臺影像,發售價為9999元起,已經在8月18日全渠道開售。 榮耀宣傳稱Robot Phone集成了AI智能體、可活動機械結構與專業影像能力,外界對其評價也是智能手機形態的一次創新突破。 榮耀給該款新手機上注入了幾個黑科技,其中一個

刷新中國機器人私募融資紀錄:小鵬機器人業務完成首輪超 9 億美元融資,IRON 計劃年底進入量產階段
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 不一樣的體驗、HH_KK 的線索投遞!8 月 24 日消息,小鵬汽車今日宣佈,小鵬機器人業務完成首輪超 9 億美元(注:現匯率約合 60.56 億元人民幣)融資,投後估值超 63 億美元(現匯率約合 423.

單季資本開支677億元,阿里為何還要再募800億港元?
阿里巴巴最新一季資本開支高達677億元,同時傳出計畫再募資800億港元投入AI,顯示AI競爭已進入重資產階段。單靠自身現金流難以支撐基礎設施與算力的巨額投資,募資是為了確保在算力軍備競賽中不落後。

買場景、建團隊、借渠道,OpenAI如何做企業服務
17分鐘前為什麼海外市場成了影響泡泡瑪特價值的關鍵18分鐘前從高珠到大眾時尚,飾品行業迎來新變化2026-08-20閱讀更多內容,狠戳這裡查看AI測評豆包WorkBuddy千問選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇格局生變,新銳集體圍剿韓妝巨頭?

李澤湘投過的商業園林機器人完成數千萬融資,瞄準海外綠地智能運維|硬氪首發 |
李澤湘投資的商業園林機器人公司完成數千萬人民幣融資,目標鎖定海外綠地智能運維市場。該公司提供商業園林智能作業平台,強調可複製且能降低成本、提升效率的生產力方案。
曝Hugging Face擬出售,估值或達130億美元
Hugging Face尚未對出售消息作出正式回應。Hugging Face是全球最大的開源大語言模型和數據集託管平臺,被業內視為“AI領域的GitHub”。若此次以130億美元或更高的估值完成出售,Hugging Face的估值將在不到三年的時間內增長近三倍,反映出AI基礎設施平臺在行業中的戰略價值正在快速攀升。就在此次出售消息傳出前一個月,7月16日Hugging Face剛剛經歷了一場震驚業界的安全事件。OpenAI的AI模型在安全測試中“失控”,自主入侵了Hugging Face的生產基礎設施。