具身大佬,為這幾個問題“吵翻”了

AIX財經2026.08.21 17:53 · 來自福建全文5408字00:00 / 15:23具身GPT時刻,到底誰說了算?文 | AIX財經(AIXcaijing),作者 | 王璐,編輯 | 阿倫人形機器人正在加速深入到各個角落。《2026人形機器人產業發展報告》數據顯示,2026年上半年我國人形機器人出貨量已超4萬臺,中國企業在全球出貨量中佔比高達97%,這意味著,全球每出貨100臺人形機器人,就有97臺來自中國製造商。但產量飆升的背後,一個更現實的問題擺在行業面前,這些機器人,有多少真正在幹活?過去幾年,人形機器人最出圈的瞬間往往是在舞臺上跳舞、後空翻,“炫技”多於“幹活”。
但今年各家都在講“落地”。2026年世界機器人大會(WRC)以“人機共生,產需共融”為主題,將“產需”置於“炫技”之前。展館裡,機器人跳舞的展臺依然圍滿觀眾,但真正吸引專業目光的,是那些在物流倉庫、藥房貨架、工廠產線上“打工”的機器人,具身智能的“表演期”正在落幕,“打工期”正式開場。頭部企業們的發言堪稱一場“大實話”合集。沒有炫技,沒有畫餅,有的是對泛化瓶頸、數據缺口、落地卡點等真實痛點的直面,以及對商業化路徑的務實探討。這些發言或許不夠華麗,卻恰恰是行業最真實的動向。本文基於8月20日“應用牽引”主題論壇發言,梳理出了人形機器人頭部企業在落地上的核心觀點與產業動向。01.
具身智能的“GPT時刻”:兩個核心爭議“具身智能何時迎來GPT時刻”近兩年被反覆提及,折射出圈內圈外對人形機器人像大語言模型一樣迎來標誌性突破的期待。在本次WRC上,宇樹科技創始人兼CEO王興興、銀河通用創始人兼首席技術官王鶴等頭部廠商,對“GPT時刻的具體標準是什麼”以及“如何到達”等關鍵問題給出了各自的回答。爭議一:GPT時刻的門檻是多少?王興興給出了一個量化的臨界線,在約80%的陌生場景中,機器人能完成約80%的任務。但他坦誠,這一時刻最快2-3年、慢則5-10年才能到來。王鶴則將門檻定為“零樣本泛化成功率70%-80%”,輕量後訓練後可接近100%。
宇樹科技創始人王興興蘇度科技聯合創始人兼CEO韓錚提出了更高的標準,具身智能要實現規模落地,大於99%的高可靠性是繞不開的前提。他指出,當前主流模仿學習路線在榜單上雖能達到80%左右的成功率,但一旦走出實驗室、面對環境或物體變化,成功率往往會顯著下降,難以滿足真實生產環境的要求。三家給出的標準從70%-80%到99%以上不等,且各自評判的維度也有所不同。雖然頭部廠商有了具體指標,但口徑不一也反映出行業對“具身智能GPT時刻”的臨界標準仍在探索之中。爭議二:泛化的瓶頸在哪裡,又如何解決?
王興興將未達到“GPT時刻”的瓶頸聚焦到AI模型與真實機器人的對齊程度不夠上,認為機器人每次輸入輸出都伴隨物理世界的偏差,最後幾釐米甚至幾毫米的觸覺修正無法完成,導致成功率下降。王鶴則將問題指向VLA與世界模型的兩段式分離。VLA必須輸出動作,因此訓練數據需要帶有動作標籤。世界模型則通過預測未來進行學習,不需要動作標籤,但它的侷限性在於“只能想象未來,無法直接決定如何執行動作”。星動紀元創始人、CEO陳建宇將瓶頸歸因到“系統級”層面。他認為主流VLA本質是模仿學習,泛化能力存在天然瓶頸,面對全新場景和任務很難自主生成合理動作。各家歸因的層次不同,解法自然也不同。
王興興的解法是“物理AI機器人自進化”,讓AI大模型自主檢索論文、生成控制代碼、在仿真與真機間自動迭代,由AI結合人工評價打分,形成正向閉環;王鶴的解法是把VLA與世界模型融合,提出World Action Model(WAM),讓模型在理解世界的同時直接生成動作;陳建宇的解法是構建“大腦-本體-場景協同進化的飛輪”。跳出各傢俱體的解法,從行業層面看,泛化的突破路徑大致可以歸納為三種側重。而上述三家的探索恰好分別落在了不同路線裡。一是技術驅動,押注模型架構創新。這是最靠近“實驗室突破”的一種,王興興的物理AI自進化與王鶴的WAM融合均可歸入此類。
星海圖是這一路線的另一代表,其創始人高繼揚在WRC上明確表示,星海圖“創新採用統一自迴歸架構,單模型同時打通零樣本泛化、通用抓取、長程任務三大核心能力”,通俗地講,這套架構把想和做重新接在了一起。二是場景驅動,押注真實商業場景中的持續交互與數據閉環。與技術驅動相對,這一路線的底層判斷是,泛化能力不是在實驗室裡設計出來的,而是在真實場景的持續迭代中逼近的。明略科技是典型代表,其創始人吳明輝判斷“機器人的下半場是大腦”,並與海康機器人合作,鎖定餐飲、零售等具體場景,讓機器人在實戰中不斷進化。三是生態驅動,押注開源協作、開發者社區與產業鏈協同。
陳建宇強調的“大腦-本體-場景協同進化”,本質上已帶有強烈的生態整合色彩,而自變量、星海圖、星動紀元則通過不同程度地擁抱開源,將生態驅動推向更廣層面。自變量把WALL-OSS-0.5開源給社區,聯合主辦全球具身智能開發者大會,據其介紹,在開發者黑客松活動中,參賽者僅用三天就跑通從數據採集到真機部署的全流程,而以往專業研究實驗室完成類似搭建至少需要六個月。泛化的突破不是單一維度的選擇題。技術驅動、場景驅動、生態驅動三種側重背後,是各家對“瓶頸歸因”的不同判斷,也決定了各自的投入方向和競爭策略。
值得注意的是,這三種驅動並非互斥,星海圖既是技術驅動也是生態驅動,明略既是場景驅動也在與海康合作構建數據閉環。真正決定各家差異的,是三種驅動的組合方式與權重分配。02.商業化落地:第一波錢從哪賺?在本次的WRC上,各家對“具身智能的第一波錢從哪賺”也給出了判斷。需要說明的是,各家並不是只賣一樣東西,而是硬件、能力、平臺、服務同時佈局,但從論壇發言和展臺展示來看,各家當前的商業化重心各有側重。第一種是靠硬件鋪量,用數據反哺算法。宇樹和星動紀元是這一方向的代表。
宇樹已在工廠實現落地應用,王興興坦言產品尚未大規模推廣的原因是“效率和泛用性能力還是不夠”,因此當前核心任務是通過高性價比的機器人本體持續鋪量,在真實場景中收集數據反哺算法迭代。星動紀元則展示了從全尺寸雙足人形機器人到靈巧手、商業服務機器人的完整產品線,自研硬件佔比超過95%,其具身物流解決方案已在物流領域批量落地。兩者的邏輯都是從結構化場景切入,先用硬件鋪量、用數據反哺,等技術和產品成熟後再向家庭延伸。圖源 / 星動紀元官網第二種是通過智能服務,賣“開箱即用”的智能體能力。銀河通用走的是這條路,但切入方式不同。
銀河通用主打“一腦多本體”,基於銀河星腦(AstraBrain),同一套智能能力驅動雙足、輪式、重載等多種形態的機器人,其智慧藥房解決方案已在全國數十個城市部署,實現7×24小時自主運營。第三種是依賴平臺生態,押注商業模式變革。星海圖和自變量代表了這一方向,但也有所不同。星海圖發佈的“1+3+N”品牌戰略的背後,源於其商業模式演變的判斷,其在演講中表示,去年到今年,行業內整機產品毛利率大致在40%-60%,到第二階段方案訂閱,硬件毛利率或降到20%左右,而到了真正的token銷售階段,整機有可能變成負毛利。
自變量則押注通用模型+開源協作,用自研通用模型同時吃下家庭和工業兩個市場,通過開源和數採基建擴大影響力,其物流分揀方案硬件成本較人形機器人方案降低約70%。第四種是押注基礎設施,做產業的“水電煤”。與前三種做本體或做大腦的公司不同,京東定位為“全球最大的物理世界運營商”,不做機器人本體,而是做數據、供應鏈、售後網絡的“賣水人”,京東雲計劃兩年內累計採集超1000萬小時真實場景數據。四種方向背後,是對行業終局的不同判斷。本體部署派賭“硬件先行、數據為王”,智能服務派賭“能力即服務”,平臺生態派賭“商業模式改變”,基礎設施派賭“賣水比淘金更穩”。03.
殊途同歸:2026,具身智能的商業化元年路徑不同,但各家都圍繞同一個行業共識展開,從展品變商品,從表演變上崗。回看本次論壇,各家的發言雖然各有側重,但不難發現他們對人形機器人行業的當前重點與難點有著四大共識。第一,2026年是具身智能從“炫技”轉向“幹活”的轉折點。從論壇主題到各家發言再到展臺佈局,各家都不再僅放Demo視頻,而是拿出了真實場景和可落地方案。競爭的維度也從“誰的機器人翻跟頭更帥”變成了“誰的實操更穩、場景更多、成本更低”。第二,泛化能力是行業公認的“GPT時刻”門票,大模型路線還在很早期。
對於“泛化能力要到什麼程度才算合格”,王興興、王鶴等都給出了不同數字,但方向一致,機器人必須能在陌生環境中自主完成任務。而對於“用什麼技術路線實現泛化”,行業還在嘗試,VLA(視覺-語言-動作)更準,世界模型更聰明,現實是各家多條路嘗試,但無論走哪條路,當前大模型在固定場景中經過專項訓練後成功率可接近100%,但只要更換物品或環境,成功率就會大幅下降。距離真正的泛化,還有不小的距離。第三,當前落地難的最大卡點在“大腦”而非“肢體”。
硬件怎麼做已經基本清楚,具身智能主要卡在大腦上,但其進化受制於數據、模型架構和評價標準三個因素,其中在最關鍵的數據維度上,雖然各家和整體行業的人形機器人數據規模快速增長,但體量還是差很多。第四,落地的節奏一致,先工業和商業,後家庭。機械臂、移動底盤、半人形機器人因為成本可控、效果可見,已經在工廠、倉庫、商場先用了起來。家庭場景因為環境複雜、要求高,還得再等等。這也解釋了為什麼銀河通用做藥房、星動紀元做物流、明略做餐飲、蘇度科技做工業,各家都選擇了“先把一件事做靠譜”的垂類場景。除了共識,在本次的論壇上還有兩個“尚未討論”清楚的問題。
首先是人形機器人賽道玩家的終局形態,究竟是贏家通吃還是百花齊放。這個問題在WRC上沒有定論。一派認為人形機器人行業會像智能手機行業一樣,5-10年後頭部企業憑藉規模、數據和品牌優勢拿走絕大多數利潤,中小玩家陸續出局。另一派則認為具身智能很難簡單復刻這一劇本,機器人軟硬件一體化的程度遠超手機,本體設計、運動控制、場景適配深度綁定,單一巨頭很難在所有品類和場景中都做到最優,再加上下游應用場景高度碎片化(工業、物流、商業、家庭對機器人的要求截然不同),更可能出現多家並存的格局,類似今天新能源汽車或工業機器人市場的競爭態勢。
兩種觀點均有道理,各方也沒有達成共識,更主流的預期是分階段演進,短期百花齊放,各路玩家在不同場景中均有生存空間;中期部分頭部企業跑出規模優勢,至於結局,則難以預料。其次是人形機器人規模化落地現在卡在了何處。2026年是具身智能從技術驗證走向商業落地的轉折點,但非規模化落地的完成點。機器人造出來了,但真正用來穩定幹活的,還很少。這卡在了哪裡?行業指向數據和模型架構兩個方向。數據方面,訓練一個好用的模型至少需要1000萬小時數據,目前全球積累量不足5%。
但更棘手的是,現有數據大多是抓杯子、簡單移動這類基礎場景,工業操作、零售服務等核心場景的數據嚴重短缺;而且不同型號的機器人數據難以通用,每家都在各自採集,效率很低。即便數據量上來了,需要什麼樣的模型架構才能把這些數據轉化成好用的“大腦”,目前沒人知道答案。數據和架構好比“雞生蛋、蛋生雞”的關係,沒有數據,架構難以驗證,而沒有統一收斂的架構,數據採集的方向也無從統一。這也是WRC上各家分歧最大、但也最需要面對的問題。2026年的WRC,沒有一家公司說自己已經抵達“GPT時刻”,但每家公司都畫出了自己的路線圖。大家路線不同,但方向一致,讓機器人走下舞臺,真正去幹活。
而當機器人不再跳舞,具身智能或許才真正拉開了大幕。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。
