人均第一,具身智能榜單能信嗎?

2026年7月21日 09:15
人均第一,具身智能榜單能信嗎?

重點摘要

具身智能賽道持續吸引資本目光的同時,各類相關榜單也如雨後春筍般湧現。當「第一」幾乎成為每家公司的標配時,這些榜單究竟還有多少可信度?近期發生的一起事件,讓這個問題變得格外尖銳。 一個多月前,千尋智能面臨了尷尬時刻。6月初,其具身基座模型 Spirit v1.6 在 RoboArena 榜單上以 1918 分的成績超過英偉達 Cosmos3 的 1880 分,一度位居「世界第一」。緊接著,千尋宣布完成 15 億元 A+ 輪融資,三個月內累計完成四輪密集融資,總額接近 50 億元,創下具身智能賽道的融資頻率新高。

站內 AI 整理稿

具身智能賽道持續吸引資本目光的同時,各類相關榜單也如雨後春筍般湧現。當「第一」幾乎成為每家公司的標配時,這些榜單究竟還有多少可信度?近期發生的一起事件,讓這個問題變得格外尖銳。 一個多月前,千尋智能面臨了尷尬時刻。6月初,其具身基座模型 Spirit v1.6 在 RoboArena 榜單上以 1918 分的成績超過英偉達 Cosmos3 的 1880 分,一度位居「世界第一」。緊接著,千尋宣布完成 15 億元 A+ 輪融資,三個月內累計完成四輪密集融資,總額接近 50 億元,創下具身智能賽道的融資頻率新高。然而,業內對評測數據的質疑從次日就開始升溫。有觀察者指出,在 310 次評測記錄中,有 72% 的分數來自兩個帳號。更值得關注的是,RoboArena 官方隨後發布聲明,經回溯調查後移除了部分存疑的評測數據,並更新了榜單排名,Spirit v1.6 也隨之從榜單上除名。 這一事件並未澆滅玩家們的熱情。翻開近半年的行業新聞,星動紀元、原力靈機、極佳視界、智元、跨維、鹿明……幾乎每一家頭部公司手裡都攥著一個「第一」,且這些「第一」的維度各不相同。這個現象或許不難理解:具身智能目前技術路線尚未統一,真機成功率大多卡在五、六成,外界想判斷一家公司到底行不行,很大程度上只能依賴榜單。可當發榜的既有高校、機構也有媒體,各家標準各不相同,有的還牽扯商單和利益關係時,榜單本身還能不能當尺子用,就成了問題。 一位關注具身賽道的投資人坦言,榜單更偏市場行為,最多算投資決策的一個參考,他對於千尋這件事並不吃驚。在他看來,真正在意名次的,往往不是以財務或技術為出發點的機構,而是一些地方引導基金或偏國資的資金,一個「第一」可能正是他們「寫在報告裡一個比較好的入口」。但也有投資人持不同看法,認為在技術門檻高、信息不對稱的早期賽道,榜單至少提供了一個橫向比較的起點。 目前市面上的具身智能榜單高達 20 餘個,大致可分成三類。第一類是 VLA 操作綜合榜,考察機器人能不能真幹活,跑的是任務成功率,代表榜單是 RoboChallenge Table30、MolmoSpaces。第二類是世界模型榜,考的是模型對物理世界的推演能力,不考機器人手腳利不利索,代表是 World Arena 和 WorldModelBench。第三類是專項基準榜,針對單點極端能力,比如雙臂協同、仿真到真機遷移,代表是 RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。 有了這層座標,近半年具身基座模型的戰報就能對號入座。今年5月,星動紀元 Era0 宣稱拿下 RoboChallenge Table30 第一;智元 GE-Sim 2.0 是 World Arena Track1 第一;跨維 DSCFuncWorld 是 World Arena Track2 第一。進入6月,千尋 Spirit v1.6 拿下 RoboArena 第一(後被除名),鹿明 Prime R0 登頂 MolmoSpaces。幾乎每一家都是第一,而且都有具體榜單排名作背書。 亂象也從各種榜單開始。最明顯的是,榜首像流水席,「第一名」更換頻繁。RoboChallenge Table30 的榜首,過去半年裡至少換了四次:先是千尋 Spirit v1.5 以 50.33% 的成功率刷新紀錄,很快又被極佳視界 GigaBrain-0.1、美國波士頓動力 Atlas、星動紀元 Era0 先後超越。這個速度比大語言模型的主流榜單更新快得多。一家頭部具身智能公司的從業者米範表示,物理世界的隨機性讓同一個模型在真機上跑兩次,成功率差三到五個百分點很正常,而測試任務的公開程度也讓各家可以照著任務專門採數據、微調模型再提交,榜首的「保質期」於是被壓到了以周計。 更讓人迷惑的是,同一個榜裡會同時冒出好幾個「第一」。World Arena 就是典型,智元 GE-Sim 2.0、跨維 DSCFuncWorld 對外都稱自己「登頂 World Arena」,但事實是這個榜單含有多條賽道,智元在 Track1(感知與動作響應)以 68.26 分排第一,跨維在 Track2(數據引擎)排第一。「第一」分屬不同子榜,對外卻被統一寫成了同一句話。對不熟悉賽道劃分的讀者來說,兩家並列的「World Arena 第一」的說法幾乎無法分辨。 還有一層更模糊的地帶是,榜單性質混雜,「第一」的含金量卻被默認成同一檔,容易產生誤導。一些公司的對外口徑裡,經常會同時列出「某模型在 RoboChallenge 排名第一」和「在某具身智能媒體的測評中也位居第一」。前者是 7×24 小時真機跑出來的成功率,後者可能只是編輯部閉門討論、甚至商務合作敲定的名單,兩者被並排放進一句話,含金量卻被默認成了同一檔。 既然榜單能撬動真金白銀,如何把「第一」造出來,也形成了潛規則。業內人士介紹,手法大致有三種。成本最低、也最普遍的一種方式是話術包裝,把「單科第一」說成「總分第一」,核心是省掉關鍵限定詞。比如實際拿的是「RoboTwin 2.0 雙臂協同 VLA 類 Clean 檔第一」,對外就變成「登頂 RoboTwin 2.0」。第二種方式是利用「刷題」直接干預結果。榜單公開的任務分佈、評分標準、環境參數,都可以拿來做定向後訓練,在一些任務相對固定的榜上尤其明顯。另一條是鑽評測機制的漏洞,例如 RoboArena 採用開放註冊、分佈式評測,短期內大量新帳號集中評測同一個模型,就能把它的 Elo 分數快速推高。第三種方式最隱蔽也最氾濫,是資源置換,把榜單直接做成生意。不少媒體榜評選標準並不透明,有的乾脆與被評對象存在商務合作,雙方聯合發一份「權威報告」,把媒體榜和學術 benchmark 並排包裝。 不止一位具身智能從業者坦言,他們當下已經不太關注榜單排名了,因為榜單能刷、能買,即便一切合規,物理環境的複雜性也讓數據很難做到百分百準確。更深一層的問題是,這個行業目前還沒有一把「通用的尺子」。從業者 gashero 用「炒雞蛋」和「拌涼菜」打比方:機器人 A 擅長炒雞蛋、成功率 90%,機器人 B 擅長拌涼菜、成功率 85%,但不能就此說 A 比 B 強,因為兩件事技能不同、難度不同、評價標準也不同。 不過,這不代表榜單一無是處。從業者普遍認為,真正可信的榜單大體同時具備三個特徵。一是分項透明,不是只甩一個「第一」。以 RoboChallenge Table30 為例,它不僅告訴讀者 64.33% 這個綜合數字,還讓讀者看到 30 項裡哪幾項做得好、哪幾項掉鏈子。二是評測由第三方掌控,且有反刷題設計。MolmoSpaces 不允許微調,模型直接「裸考」;LIBERO-Plus 則加了光照突變、背景雜亂、相機角度變化等極端擾動。三是看評測機制,而不是看更新頻率。有些榜更新慢是因為真機評測成本極高,比如 RoboChallenge 一次完整評測週期可能要數週;有些榜更新快則是機制設計,如 RoboArena 採用 Elo 評分系統進行動態排名,可信度取決於機制是否嚴密。 眼下這場「第一」的爭奪戰,本質上是資本焦慮的產物。今年是具身基座模型密集迭代的一年,早期賽道出貨量、營收、訂單量都不穩定,只能拿榜單頂上。融資導向的階段沒變,刷榜這件事就不會停。當行業進入下一階段,評判的標尺會自然切換到每年交付多少臺、有哪些固定客戶、是否能盈利。到那時候,「第一」的通貨膨脹會自然消散,榜單也會退回它本該在的位置。或許,那些不忙著刷榜、只顧著把機器人送進產線的公司,才是行業真正的答案。

Related

相關文章

姚期智最新演講: AI有邊界,恰恰是好事

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道四川最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作姚期智最新演講: AI有邊界,恰恰是好事大數據文摘·2026年07月21日 18:01AI並非無所不能,看清它的邊界,既是安全的起點,也是下一次躍遷的起點。 2026年,AI似乎已經無所不能:下圍棋、預測蛋白質結構、寫代碼、做科研,甚至開始“自己做數學”。 但一個更根本的問題,很少有人正面回答:AI的能力,到底有沒有理論邊界?而在邊界之外,AI的“下一層級”又是什麼? 2026年7月,在2026世界人工智能大會(WAIC)上,圖靈獎得主、中國科學院院士、清華大學交叉信息研究院院長、人工智能學院院長、上海期智研究院院長姚期智,帶來了題為《人工智能的威力與侷限:從理論計算機科學的視角》的主旨演講。 他根據理論計算機科學的本源,給出了三個判斷:AI的本質是“圖靈機+數據”,因此有些問題它註定無法解決;AI的侷限不是壞消息,恰恰是AI安全的理論基石;AI的下一層級,不在於“AI for Science”,而在於“Science for AI”,量子AI正在浮現。 以下為姚期智演講內容,經編輯整理,有刪改。 1. AI的本質:機器學習給算法裝上了“數據”這件武器 我們先來反思一下AI的本質。AI依賴一個非常強大的工具:機器學

剛剛

讓“神筆馬良”成真,這家 AI 公司估值過百億

讓“神筆馬良”成真,這家 AI 公司估值過百億藍字計劃2026.07.21 17:55 · 來自廣東全文4018字00:00 / 11:23把成本壓到一千分之一。文 | 藍字計劃,作者|周松捲到白菜價的3D打印機,又等來新的攔路虎。在消費級打印機從兩三千元跌到800元、耗材低至2元的時候,不少用戶才發現,還是避免不了吃灰的命運。想打印一個自己喜歡的角色,要麼去模型網站翻上幾十頁,從別人做好的模型中碰碰運氣;要麼學習專業建模軟件,自己一點點把想法“捏”出來;又或者只能發揮“鈔能力”,選擇又貴又慢的定製方案。但現在,有一家公司跑出來說,建模也可以不用鼠標和鍵盤慢慢捏,直接用嘴說也行。它叫Meshy,讀起來有點像“咩西”。圖源:Meshy官方賬號雖然名字聽起來很專業,操作卻被它做得像“傻瓜相機”一樣簡單:用戶只要輸入一句文字,或者上傳一張參考圖片,就能讓AI生成一個3D模型。靠著“用嘴建模”這件事,Meshy也拿到了一大筆錢。7月20日,AI 3D公司Meshy宣佈完成近4億美元B輪融資,投後估值超過100億元人民幣。據公司披露,Meshy的註冊用戶已超過1200萬,累計生成的3D模型超過1億個,過去一年營收增長了12倍。如今,讓AI畫出一張圖片早已不稀奇。而Meshy想做的,是讓AI先把一句話變成完整的3D模型,再交給3D打印機,把屏幕裡的東西“摳”出來,變成一個可以拿在手裡的實物。難道,現實的“神筆馬良”終於要來了?讓AI畫3D,差點難過登天也許很多人不知道,讓AI 畫一張 3D 的圖,要比畫一張普通的平面圖片難上幾個數量級。最關鍵的難點在於,AI 畫出來的3D模型要經得起旋轉、各個角度的考驗。不僅正面看著要正常,背面和側面也不能突然走樣;用戶只上傳一張照片時,那些沒有拍到的地方,還得由AI自己腦補出來。圖源:Meshy官方賬號這就像只給雕塑師看一張正面照,卻要求他捏出一個可

剛剛

圓桌論壇:夏天週而復始·VC3.0| 36氪WAVES2026新浪潮

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

WAIC現場:暴走三萬步,看機器人的四個變化

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

網宿科技與深度動力聯合發佈全鏈路優化解決方案,提升每瓦Token效率

網宿科技與深度動力近日宣布聯手推出「綠電→電網→芯片→算力→Token」全鏈路效率優化解決方案,旨在透過從能源端到運算輸出的完整鏈條最佳化,顯著提升每瓦Token的產出效率。雙方結合各自在邊緣運算、能源管理與晶片設計的技術優勢,針對當前AI工作負載下能耗與算力需求持續攀升的趨勢,提出從綠電接入、電網調度、晶片功耗控制到算力調度及Token生成效率的全環節協同機制。

剛剛

AI時代、產業革命與未來文明訪談——張丁文:未來不屬於追趕者

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛