WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”

2026年7月21日 19:07
WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”

重點摘要

在2026世界人工智能大會上,具身智能企業聚焦機器人真實場景落地,業界認為最快兩年內將迎來機器人「ChatGPT時刻」。然而,訓練世界模型仍面臨數據、表徵與閉環三大挑戰,各企業在數據來源與模型架構上各有不同策略。

站內 AI 整理稿

想像一個場景:你對機器人說「幫我把洗衣機裡的衣服拿出來晾曬」,它看了看洗衣機的門,規劃手臂的開門軌跡,緩緩打開艙門,發現衣物纏在一起,它停頓思考一下,重新調整策略,將纏繞的衣物一件件抽出,整理好掛在晾衣杆上。這個場景之所以令人興奮,不是因為機器人「做到了」,而是因為它「想到了」——它是在理解世界、預測後果、調整行動。這就是世界模型想要實現的東西:讓機器像人一樣,在行動之前先在腦海裡推演一遍「我這麼做,是否符合這個世界的物理規律」。 2026年被視為具身智能部署元年,在今年的世界人工智能大會上,具身智能企業不再像此前那樣展現機器人的「舞蹈功底」,而是將真實產線搬到了展臺。機器人如何感知環境、理解任務、執行動作,並在真實反饋中持續進化?世界模型、物理AI的「ChatGPT時刻」還有多遠?大家都在追逐機器人場景落地,但對於「終點前的最後一段路該怎麼走」,業界還有許多不同的觀點。 世界模型的本質是什麼?智元合夥人、高級副總裁、具身業務部總裁姚卯青給出這樣的看法:能夠理解物理世界運行規律的AI系統,其中最重要的功能是「能夠預測世界的下一步狀態」。他認為,世界模型需要掌握三項關鍵能力:多模態融合理解,能準確感知環境的變化;物理規律認知,涵蓋動力學及時空理解;因果推理,具備長時序推理而不崩壞的能力。從「看到了什麼」到「世界會怎樣變化」再到「如果我這麼做會怎樣」,構成一條完整的智能鏈條。 然而,訓練這樣一個模型所需的數據,與現實能提供的數據之間,橫亙著巨大的鴻溝。在「智啟具身論壇2026:迎接物理AI智能湧現」分論壇上,姚卯青坦言,語言模型頭部團隊已經用到了100萬億Tokens的語料,約合100億小時的人類說話時長,而具身智能所需的物理世界數據,信息密度遠低於語言,目前還差了萬倍以上。這便是物理智能要實現規模化必須突破的第一道「數據牆」。除此之外,姚卯青還表示,跨任務、跨場景、跨本體的統一物理表徵尚未形成,「表徵牆」還沒有打通;真實試錯代價昂貴、反饋緩慢,難以規模化,「閉環牆」也是阻礙。 圍繞數據來源,不同企業也給出了不同的解法。Sunday Robotics聯合創始人兼CEO趙子豪介紹一種低成本、無本體差異的採集方式UMI(通用操作接口)數據,在他看來,這是短期提升智能最有效的手段。但Physical Intelligence研究科學家任至意則堅持真機數據的不可替代性,「只有真機採集的數據,才能在機器人上完整復現任務」。Dyna Robotics聯合創始人馬也騁則給出另一種視角,他提出「數據金字塔」方案,把互聯網視頻、第一人稱數據、真機數據、部署迴流數據分為三層,各司其職。這場關於數據的討論暗示著一個事實:沒有任何單一來源能解決物理AI的數據飢渴難題。 儘管大模型智能程度越來越高,但不少具身智能從業者發現,這條路徑或許不能直接平移到物理AI領域,甚至網上冒出「VLA(視覺-語言-動作模型)已死,World Action Model(世界動作模型WAM)當立」的言論。任至意的回應很直接:「到目前為止,沒有看到哪家能做到比π0.7更亮眼的demo,所以VLA還沒有死。」但他也承認,VLA和WAM並不衝突,未來真正要做的是訓練一個原生理解context、知道怎麼生成未來的模型。馬也騁的視角來自不同的實戰經驗,Dyna已經從VLA切換到WAM架構,因為他發現在部分強調高成功率和少數據效率的任務中,WAM可能比VLA更高效。 騰訊首席科學家張正友的視角更宏觀,他認為具身智能尚處於早期階段,還沒有像大語言模型的Transformer那樣收斂的統一框架。他提出的認知系統、感知行動系統、底層反應系統三層架構,更像一個完整的Agent系統,而非單一的VLA或WAM。姚卯青則認為,VLA與WAM兩條路線都需要持續演進,並推動二者走向統一,下一代模型將是WRAM(世界推理動作大模型)。對此,智元推出自研GO-2基座模型、Act2Goal世界模型、GE-Sim2.0等多款VLA與WAM模型,搭配SOP(標準操作流程)、Genie Evolver百臺級分佈式真機強化學習體系,從算法、仿真、真機訓練層面打通規模化迭代閉環。 如何把數據、訓練、部署串成一個持續運轉的系統,是世界模型落地驗證繞不開的核心命題。智元提出「預訓練—後訓練—持續學習」的三階段訓練架構,在嘉興搭建的Genie Evolver系統,實現超過100臺機器人同時進行在線策略迭代訓練,機器人集群實時上報交互數據,雲端完成模型更新後,權重可在2秒內下發到所有機器人,訓練週期壓縮到「分鐘級」。無界動力則選擇了「隱空間世界模型+強化學習」雙輪驅動的技術思路,以隱空間世界模型建立「世界觀」,以強化學習塑造「價值觀」,不依賴在像素空間裡生成逼真視頻,而是在壓縮後的隱空間裡完成對未來狀態的推演。 物理世界的動態變化瞬息萬變,模型的推理效率成為決定機器人能否順利完成現實中動態任務的關鍵。大曉機器人發佈的開悟世界模型3.1,在端側實現125毫秒的推理延遲,意味著複雜的「理解—推演—執行—反思」閉環可以在機器人本體上實時完成,無需依賴雲端算力。螞蟻靈波則展示其世界模型在消費級顯卡上達到90至150赫茲的推理效率,強調「從頭為物理世界設計」的架構在效率上的優勢。 部署驗證是最後一塊拼圖。智元機器人在江西南昌的3C產線上實現99.99%的成功率,已穩定運行數月;Dyna Robotics在馬薩諸塞州一家餐廳裡完成了餐巾摺疊的商業驗證,機器人24小時無人干預下自主摺疊超過850個餐巾,成功率99.4%;大曉機器人採取「先ToB後ToC」的策略,推出面向即時零售、酒店洗衣、巡檢安防的三套方案,其「曉滿」一體化履約方案已進入真實零售場景,計劃未來一年完成1000家零售場景落地。這些數字和案例的意義在於,它們不再是實驗室裡的「偶發成功」,而是真實場景中可重複、可驗證的證明。 如果說數據、模型、場景是物理AI的「內功」,那麼評測標準就是這個行業的「度量衡」。在世界模型「六小龍」巔峰論壇的圓桌環節,六位嘉賓都認為,當前沒有一個公平、標準、統一的世界模型評測基準。大部分評測仍然停留在視頻生成類型上,但這些指標與機器人真正需要的「物理因果推演能力」之間存在本質錯位。自變量機器人CTO王浩指出,今天的世界模型「可能99%的像素對決策毫無用處」,但行業卻花了大量算力去預測這些無用像素。針對這一痛點,具身物理智能統一評測基準平臺Physical IQ物智亮相,這是國內首個具身原生、面向多場景、多本體、多任務的物理智能評測基準平臺,以統一協議貫通零售、工業、家居等真實場景。 論壇上,業界學者和專家也都給出自己對於機器人「ChatGPT時刻」的時間預測。姚卯青認為最快是兩年,任至意、馬也騁判斷是四年左右,張正友則估計是三至五年。從數據困境到模型爭辯,再到場景驗證與評測標準的建立,物理AI的爆發路徑逐漸清晰。儘管前方仍有重重挑戰,但業界普遍共識是:機器人學會「三思而後行」的時刻,離我們並不遙遠。

Related

相關文章

全天候科技生成式AI

谷歌推出Gemini 3.6 Flash,3.5 Flash-LITE,以及3.5 Flash Cyber

谷歌AI突然“開火”:三款Gemini模型齊發,最高降價近七成,旗艦3.5 Pro仍難產 李丹 發表於 2026年07月21日 15:19 摘要:Gemini 3.6 Flash主打代碼、知識工作和多模態任務,在減少輸出Token消耗的同時,價格也低於上一代;Gemini 3.5 Flash-Lite瞄準高吞吐、低延遲場景;Gemini 3.

剛剛

Google要把AI大模型「刻」進芯片裡

Google正推動將大型AI模型直接固化在晶片硬體層級,以減少對外部記憶體與頻寬的依賴。此技術若成真,可大幅降低推論階段的延遲與功耗,對大規模部署生成式AI服務極具戰略意義。

剛剛

AI獨角獸創始人最新判斷:90%企業AI場景,已經不需要最強模型

AI獨角獸Glean創辦人指出,目前超過九成企業AI應用場景不需使用最強模型,開源模型已能滿足多數需求。企業導入AI的真正瓶頸在於上下文工程,而非模型能力,模型商品化將使價值轉向應用層。應用公司應深入客戶核心工作流程,不必過度擔心模型廠商直接競爭。

剛剛
鈦媒體生成式AI

印奇的手機,階躍星辰的賭局

根據鈦媒體的報導,印奇的手機業務與階躍星辰的賭局成為近期科技圈的討論焦點。印奇作為曠視科技的創始人,其跨足手機領域的動作引發市場關注;而階躍星辰則被報導描述為在一場AI技術的賭局中下注。報導聚焦於兩者之間的戰略關聯與市場風險,但目前僅能從標題中窺見其核心方向,具體的產品細節、合作夥伴及定價策略等資訊尚未完整揭露。

剛剛

在下一個模型發佈之前

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛