人均第一,具身智能榜單能信嗎?

2026年7月21日 09:15
人均第一,具身智能榜單能信嗎?

重點摘要

具身智能賽道持續吸引資本目光的同時,各類相關榜單也如雨後春筍般湧現。當「第一」幾乎成為每家公司的標配時,這些榜單究竟還有多少可信度?近期發生的一起事件,讓這個問題變得格外尖銳。 一個多月前,千尋智能面臨了尷尬時刻。6月初,其具身基座模型 Spirit v1.6 在 RoboArena 榜單上以 1918 分的成績超過英偉達 Cosmos3 的 1880 分,一度位居「世界第一」。緊接著,千尋宣布完成 15 億元 A+ 輪融資,三個月內累計完成四輪密集融資,總額接近 50 億元,創下具身智能賽道的融資頻率新高。

站內 AI 整理稿

具身智能賽道持續吸引資本目光的同時,各類相關榜單也如雨後春筍般湧現。當「第一」幾乎成為每家公司的標配時,這些榜單究竟還有多少可信度?近期發生的一起事件,讓這個問題變得格外尖銳。一個多月前,千尋智能面臨了尷尬時刻。6月初,其具身基座模型 Spirit v1.6 在 RoboArena 榜單上以 1918 分的成績超過英偉達 Cosmos3 的 1880 分,一度位居「世界第一」。緊接著,千尋宣布完成 15 億元 A+ 輪融資,三個月內累計完成四輪密集融資,總額接近 50 億元,創下具身智能賽道的融資頻率新高。然而,業內對評測數據的質疑從次日就開始升溫。

有觀察者指出,在 310 次評測記錄中,有 72% 的分數來自兩個帳號。更值得關注的是,RoboArena 官方隨後發布聲明,經回溯調查後移除了部分存疑的評測數據,並更新了榜單排名,Spirit v1.6 也隨之從榜單上除名。這一事件並未澆滅玩家們的熱情。翻開近半年的行業新聞,星動紀元、原力靈機、極佳視界、智元、跨維、鹿明……幾乎每一家頭部公司手裡都攥著一個「第一」,且這些「第一」的維度各不相同。這個現象或許不難理解:具身智能目前技術路線尚未統一,真機成功率大多卡在五、六成,外界想判斷一家公司到底行不行,很大程度上只能依賴榜單。

可當發榜的既有高校、機構也有媒體,各家標準各不相同,有的還牽扯商單和利益關係時,榜單本身還能不能當尺子用,就成了問題。一位關注具身賽道的投資人坦言,榜單更偏市場行為,最多算投資決策的一個參考,他對於千尋這件事並不吃驚。在他看來,真正在意名次的,往往不是以財務或技術為出發點的機構,而是一些地方引導基金或偏國資的資金,一個「第一」可能正是他們「寫在報告裡一個比較好的入口」。但也有投資人持不同看法,認為在技術門檻高、信息不對稱的早期賽道,榜單至少提供了一個橫向比較的起點。目前市面上的具身智能榜單高達 20 餘個,大致可分成三類。

第一類是 VLA 操作綜合榜,考察機器人能不能真幹活,跑的是任務成功率,代表榜單是 RoboChallenge Table30、MolmoSpaces。第二類是世界模型榜,考的是模型對物理世界的推演能力,不考機器人手腳利不利索,代表是 World Arena 和 WorldModelBench。第三類是專項基準榜,針對單點極端能力,比如雙臂協同、仿真到真機遷移,代表是 RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。有了這層座標,近半年具身基座模型的戰報就能對號入座。

今年5月,星動紀元 Era0 宣稱拿下 RoboChallenge Table30 第一;智元 GE-Sim 2.0 是 World Arena Track1 第一;跨維 DSCFuncWorld 是 World Arena Track2 第一。進入6月,千尋 Spirit v1.6 拿下 RoboArena 第一(後被除名),鹿明 Prime R0 登頂 MolmoSpaces。幾乎每一家都是第一,而且都有具體榜單排名作背書。亂象也從各種榜單開始。最明顯的是,榜首像流水席,「第一名」更換頻繁。

RoboChallenge Table30 的榜首,過去半年裡至少換了四次:先是千尋 Spirit v1.5 以 50.33% 的成功率刷新紀錄,很快又被極佳視界 GigaBrain-0.1、美國波士頓動力 Atlas、星動紀元 Era0 先後超越。這個速度比大語言模型的主流榜單更新快得多。一家頭部具身智能公司的從業者米範表示,物理世界的隨機性讓同一個模型在真機上跑兩次,成功率差三到五個百分點很正常,而測試任務的公開程度也讓各家可以照著任務專門採數據、微調模型再提交,榜首的「保質期」於是被壓到了以周計。更讓人迷惑的是,同一個榜裡會同時冒出好幾個「第一」。

World Arena 就是典型,智元 GE-Sim 2.0、跨維 DSCFuncWorld 對外都稱自己「登頂 World Arena」,但事實是這個榜單含有多條賽道,智元在 Track1(感知與動作響應)以 68.26 分排第一,跨維在 Track2(數據引擎)排第一。「第一」分屬不同子榜,對外卻被統一寫成了同一句話。對不熟悉賽道劃分的讀者來說,兩家並列的「World Arena 第一」的說法幾乎無法分辨。還有一層更模糊的地帶是,榜單性質混雜,「第一」的含金量卻被默認成同一檔,容易產生誤導。

一些公司的對外口徑裡,經常會同時列出「某模型在 RoboChallenge 排名第一」和「在某具身智能媒體的測評中也位居第一」。前者是 7×24 小時真機跑出來的成功率,後者可能只是編輯部閉門討論、甚至商務合作敲定的名單,兩者被並排放進一句話,含金量卻被默認成了同一檔。既然榜單能撬動真金白銀,如何把「第一」造出來,也形成了潛規則。業內人士介紹,手法大致有三種。成本最低、也最普遍的一種方式是話術包裝,把「單科第一」說成「總分第一」,核心是省掉關鍵限定詞。比如實際拿的是「RoboTwin 2.0 雙臂協同 VLA 類 Clean 檔第一」,對外就變成「登頂 RoboTwin 2.0」。

第二種方式是利用「刷題」直接干預結果。榜單公開的任務分佈、評分標準、環境參數,都可以拿來做定向後訓練,在一些任務相對固定的榜上尤其明顯。另一條是鑽評測機制的漏洞,例如 RoboArena 採用開放註冊、分佈式評測,短期內大量新帳號集中評測同一個模型,就能把它的 Elo 分數快速推高。第三種方式最隱蔽也最氾濫,是資源置換,把榜單直接做成生意。不少媒體榜評選標準並不透明,有的乾脆與被評對象存在商務合作,雙方聯合發一份「權威報告」,把媒體榜和學術 benchmark 並排包裝。

不止一位具身智能從業者坦言,他們當下已經不太關注榜單排名了,因為榜單能刷、能買,即便一切合規,物理環境的複雜性也讓數據很難做到百分百準確。更深一層的問題是,這個行業目前還沒有一把「通用的尺子」。從業者 gashero 用「炒雞蛋」和「拌涼菜」打比方:機器人 A 擅長炒雞蛋、成功率 90%,機器人 B 擅長拌涼菜、成功率 85%,但不能就此說 A 比 B 強,因為兩件事技能不同、難度不同、評價標準也不同。不過,這不代表榜單一無是處。從業者普遍認為,真正可信的榜單大體同時具備三個特徵。一是分項透明,不是只甩一個「第一」。以 RoboChallenge Table30 為例,它不僅告訴讀者 64.

33% 這個綜合數字,還讓讀者看到 30 項裡哪幾項做得好、哪幾項掉鏈子。二是評測由第三方掌控,且有反刷題設計。MolmoSpaces 不允許微調,模型直接「裸考」;LIBERO-Plus 則加了光照突變、背景雜亂、相機角度變化等極端擾動。三是看評測機制,而不是看更新頻率。有些榜更新慢是因為真機評測成本極高,比如 RoboChallenge 一次完整評測週期可能要數週;有些榜更新快則是機制設計,如 RoboArena 採用 Elo 評分系統進行動態排名,可信度取決於機制是否嚴密。眼下這場「第一」的爭奪戰,本質上是資本焦慮的產物。

今年是具身基座模型密集迭代的一年,早期賽道出貨量、營收、訂單量都不穩定,只能拿榜單頂上。融資導向的階段沒變,刷榜這件事就不會停。當行業進入下一階段,評判的標尺會自然切換到每年交付多少臺、有哪些固定客戶、是否能盈利。到那時候,「第一」的通貨膨脹會自然消散,榜單也會退回它本該在的位置。或許,那些不忙著刷榜、只顧著把機器人送進產線的公司,才是行業真正的答案。

Related

相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人

美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

剛剛

一口氣發佈三款教育插件,OpenAI教育產品再升級

OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

剛剛

騰訊、字節、阿里,搶著給打工人配「AI助理」

騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

剛剛

推行AI提效後,策劃們開始加班趕工期

當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

18 分鐘前

DeepSeek大漲價,Token價格戰終於要結束了?

DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

46 分鐘前

狂攬130億!英偉達投的AI基建獨角獸又融資了

澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。

50 分鐘前