WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”

2026年7月21日 19:07
WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”

重點摘要

在2026世界人工智能大會上,具身智能企業聚焦機器人真實場景落地,業界認為最快兩年內將迎來機器人「ChatGPT時刻」。然而,訓練世界模型仍面臨數據、表徵與閉環三大挑戰,各企業在數據來源與模型架構上各有不同策略。

站內 AI 整理稿

想像一個場景:你對機器人說「幫我把洗衣機裡的衣服拿出來晾曬」,它看了看洗衣機的門,規劃手臂的開門軌跡,緩緩打開艙門,發現衣物纏在一起,它停頓思考一下,重新調整策略,將纏繞的衣物一件件抽出,整理好掛在晾衣杆上。這個場景之所以令人興奮,不是因為機器人「做到了」,而是因為它「想到了」——它是在理解世界、預測後果、調整行動。這就是世界模型想要實現的東西:讓機器像人一樣,在行動之前先在腦海裡推演一遍「我這麼做,是否符合這個世界的物理規律」。2026年被視為具身智能部署元年,在今年的世界人工智能大會上,具身智能企業不再像此前那樣展現機器人的「舞蹈功底」,而是將真實產線搬到了展臺。

機器人如何感知環境、理解任務、執行動作,並在真實反饋中持續進化?世界模型、物理AI的「ChatGPT時刻」還有多遠?大家都在追逐機器人場景落地,但對於「終點前的最後一段路該怎麼走」,業界還有許多不同的觀點。世界模型的本質是什麼?智元合夥人、高級副總裁、具身業務部總裁姚卯青給出這樣的看法:能夠理解物理世界運行規律的AI系統,其中最重要的功能是「能夠預測世界的下一步狀態」。他認為,世界模型需要掌握三項關鍵能力:多模態融合理解,能準確感知環境的變化;物理規律認知,涵蓋動力學及時空理解;因果推理,具備長時序推理而不崩壞的能力。

從「看到了什麼」到「世界會怎樣變化」再到「如果我這麼做會怎樣」,構成一條完整的智能鏈條。然而,訓練這樣一個模型所需的數據,與現實能提供的數據之間,橫亙著巨大的鴻溝。在「智啟具身論壇2026:迎接物理AI智能湧現」分論壇上,姚卯青坦言,語言模型頭部團隊已經用到了100萬億Tokens的語料,約合100億小時的人類說話時長,而具身智能所需的物理世界數據,信息密度遠低於語言,目前還差了萬倍以上。這便是物理智能要實現規模化必須突破的第一道「數據牆」。除此之外,姚卯青還表示,跨任務、跨場景、跨本體的統一物理表徵尚未形成,「表徵牆」還沒有打通;真實試錯代價昂貴、反饋緩慢,難以規模化,「閉環牆」也是阻礙。

圍繞數據來源,不同企業也給出了不同的解法。Sunday Robotics聯合創始人兼CEO趙子豪介紹一種低成本、無本體差異的採集方式UMI(通用操作接口)數據,在他看來,這是短期提升智能最有效的手段。但Physical Intelligence研究科學家任至意則堅持真機數據的不可替代性,「只有真機採集的數據,才能在機器人上完整復現任務」。Dyna Robotics聯合創始人馬也騁則給出另一種視角,他提出「數據金字塔」方案,把互聯網視頻、第一人稱數據、真機數據、部署迴流數據分為三層,各司其職。這場關於數據的討論暗示著一個事實:沒有任何單一來源能解決物理AI的數據飢渴難題。

儘管大模型智能程度越來越高,但不少具身智能從業者發現,這條路徑或許不能直接平移到物理AI領域,甚至網上冒出「VLA(視覺-語言-動作模型)已死,World Action Model(世界動作模型WAM)當立」的言論。任至意的回應很直接:「到目前為止,沒有看到哪家能做到比π0.7更亮眼的demo,所以VLA還沒有死。」但他也承認,VLA和WAM並不衝突,未來真正要做的是訓練一個原生理解context、知道怎麼生成未來的模型。馬也騁的視角來自不同的實戰經驗,Dyna已經從VLA切換到WAM架構,因為他發現在部分強調高成功率和少數據效率的任務中,WAM可能比VLA更高效。

騰訊首席科學家張正友的視角更宏觀,他認為具身智能尚處於早期階段,還沒有像大語言模型的Transformer那樣收斂的統一框架。他提出的認知系統、感知行動系統、底層反應系統三層架構,更像一個完整的Agent系統,而非單一的VLA或WAM。姚卯青則認為,VLA與WAM兩條路線都需要持續演進,並推動二者走向統一,下一代模型將是WRAM(世界推理動作大模型)。對此,智元推出自研GO-2基座模型、Act2Goal世界模型、GE-Sim2.0等多款VLA與WAM模型,搭配SOP(標準操作流程)、Genie Evolver百臺級分佈式真機強化學習體系,從算法、仿真、真機訓練層面打通規模化迭代閉環。

如何把數據、訓練、部署串成一個持續運轉的系統,是世界模型落地驗證繞不開的核心命題。智元提出「預訓練—後訓練—持續學習」的三階段訓練架構,在嘉興搭建的Genie Evolver系統,實現超過100臺機器人同時進行在線策略迭代訓練,機器人集群實時上報交互數據,雲端完成模型更新後,權重可在2秒內下發到所有機器人,訓練週期壓縮到「分鐘級」。無界動力則選擇了「隱空間世界模型+強化學習」雙輪驅動的技術思路,以隱空間世界模型建立「世界觀」,以強化學習塑造「價值觀」,不依賴在像素空間裡生成逼真視頻,而是在壓縮後的隱空間裡完成對未來狀態的推演。

物理世界的動態變化瞬息萬變,模型的推理效率成為決定機器人能否順利完成現實中動態任務的關鍵。大曉機器人發佈的開悟世界模型3.1,在端側實現125毫秒的推理延遲,意味著複雜的「理解—推演—執行—反思」閉環可以在機器人本體上實時完成,無需依賴雲端算力。螞蟻靈波則展示其世界模型在消費級顯卡上達到90至150赫茲的推理效率,強調「從頭為物理世界設計」的架構在效率上的優勢。部署驗證是最後一塊拼圖。智元機器人在江西南昌的3C產線上實現99.99%的成功率,已穩定運行數月;Dyna Robotics在馬薩諸塞州一家餐廳裡完成了餐巾摺疊的商業驗證,機器人24小時無人干預下自主摺疊超過850個餐巾,成功率99.

4%;大曉機器人採取「先ToB後ToC」的策略,推出面向即時零售、酒店洗衣、巡檢安防的三套方案,其「曉滿」一體化履約方案已進入真實零售場景,計劃未來一年完成1000家零售場景落地。這些數字和案例的意義在於,它們不再是實驗室裡的「偶發成功」,而是真實場景中可重複、可驗證的證明。如果說數據、模型、場景是物理AI的「內功」,那麼評測標準就是這個行業的「度量衡」。在世界模型「六小龍」巔峰論壇的圓桌環節,六位嘉賓都認為,當前沒有一個公平、標準、統一的世界模型評測基準。大部分評測仍然停留在視頻生成類型上,但這些指標與機器人真正需要的「物理因果推演能力」之間存在本質錯位。

自變量機器人CTO王浩指出,今天的世界模型「可能99%的像素對決策毫無用處」,但行業卻花了大量算力去預測這些無用像素。針對這一痛點,具身物理智能統一評測基準平臺Physical IQ物智亮相,這是國內首個具身原生、面向多場景、多本體、多任務的物理智能評測基準平臺,以統一協議貫通零售、工業、家居等真實場景。論壇上,業界學者和專家也都給出自己對於機器人「ChatGPT時刻」的時間預測。姚卯青認為最快是兩年,任至意、馬也騁判斷是四年左右,張正友則估計是三至五年。從數據困境到模型爭辯,再到場景驗證與評測標準的建立,物理AI的爆發路徑逐漸清晰。

儘管前方仍有重重挑戰,但業界普遍共識是:機器人學會「三思而後行」的時刻,離我們並不遙遠。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

10 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前