世界模型如何走向物理世界?看看這些專家怎麼說

2026年9月11日 01:39
站內 AI 整理稿

當人工智能從屏幕中的對話、創作與編程,走向真實環境中的感知、決策與行動,它需要面對一套更復雜的考驗。無論是自動駕駛車輛應對動態路況,還是機器人完成取物、洗衣等日常任務,都要求AI理解空間關係、預測行動後果,並根據環境變化及時調整。正因如此,世界模型被寄予厚望。它有望為AI提供在行動之前,推演未來的能力。從生成逼真的視頻,到預測行動後果,再到驅動機器人完成真實任務,世界模型正在連接數字空間與物理世界。但模型能否真正理解環境、在變化中可靠執行,並以可承受的成本實現落地,仍有待進一步探索,這也是行業近段時間討論的重點。

9月10日下午2026 Inclusion·外灘大會上,由香港大學計算與數據科學學院主辦、香港大學上海智能計算研究院協辦的, “世界模型是AI走向物理世界的新大陸嗎”見解論壇正式舉行。來自高校與企業的嘉賓圍繞世界模型的能力邊界、具身智能的技術路徑及商業化挑戰展開交流。馬毅:人工智能時代的產學研融合香港大學計算與數據科學學院創始院長馬毅教授在開幕致辭中,介紹了港大計算與數據科學領域的學科建設及在上海的教學科研佈局。他表示,人工智能的快速發展正在改變人才培養、科學研究與產業轉化之間的關係。過去相對分離的教學、科研和成果應用,如今越來越需要在同一創新過程中緊密結合。

香港大學計算與數據科學學院創始院長馬毅教授 馬毅指出,香港大學希望發揮國際化教育及學術研究優勢,結合上海的產業、人才和創新資源,探索適應人工智能時代的產學研協同模式,並推動AI在醫療、健康、能源、材料等領域的應用。他也鼓勵高校教師將前沿研究轉化為創業實踐,增強高校與產業的聯繫。談及世界模型,馬毅表示,三維與四維世界的感知和建模一直是計算機視覺研究的重要問題。今天的世界模型已經超出傳統三維重建和物體識別的範疇,進一步指向機器人在開放物理環境中的感知、認知、學習與交互。這一變化也為高校研究與產業合作帶來了新的空間。

王曉剛:物理AI的開悟時刻大曉機器人董事長、商湯科技聯合創始人兼執行董事、香港中文大學電子工程系教授王曉剛,以《物理AI的開悟時刻》為題,分享了世界模型、高質量數據與機器人場景落地相結合的實踐。大曉機器人董事長、商湯科技聯合創始人兼執行董事、香港中文大學電子工程系教授王曉剛 王曉剛認為,具身智能要從特定任務走向更廣泛的應用,需要同時突破數據與模型兩方面的限制。圍繞單一任務反覆採集真機數據、訓練模型的方式,難以經濟地覆蓋真實世界中不斷變化的需求。

大曉提出的ACE研發範式,強調通過穿戴式傳感設備,在真實生產生活環境中採集人類行為數據,並與真機數據融合,減少新任務和新本體適配對大量專門採集數據的依賴。在模型方面,王曉剛介紹了開悟世界模型“理解、生成、預測”一體化的架構:通過理解判斷環境和任務狀態,通過生成推演不同動作可能產生的後果,再通過預測支持機器人控制,三種能力共享特徵並形成反饋閉環。他以洗衣等長程任務為例指出,機器人不僅需要識別空間關係、分解任務,還要判斷每一步是否完成,並據此調整後續動作。數據質量是這一路徑的重要基礎。王曉剛表示,真實場景中包含多視角、力觸覺和交互反饋的數據,有助於模型學習物體屬性與物理規律。

相比在固定環境中重複執行相同任務,開放環境中的多樣化行為及失敗案例,對提升模型泛化能力更有價值。他同時介紹了環境式數據採集設備、自動化數據生產平臺、ACE-Data-0開源數據及相關評測建設。在產業應用方面,大曉正通過“一腦多形”適配不同機器人本體,並圍繞即時零售、酒店洗衣及開放場景自主作業推進落地。王曉剛表示,商業部署既是模型能力的檢驗,也是持續獲得真實數據、推動模型迭代的途徑。駱怡航:通用世界模型的探索與實踐生數科技聯合創始人兼CEO駱怡航以《在行動前,看見未來:從世界模型第一性原理出發》為題發表演講。他認為,AI要在物理世界中行動,需要先感知環境、推演未來,再根據行動結果持續修正決策。

通用世界模型應當具備理解、預測與行動的完整閉環,單獨的視頻生成、空間重建或策略控制,只覆蓋了其中的部分能力。生數科技聯合創始人兼CEO駱怡航 圍繞這一判斷,駱怡航介紹了生數科技提出的五級演進路線:從模擬和生成世界,到實時交互,再到驅動物理行動,進一步發展為能夠自主規劃和迭代的世界智能體,最終探索多智能體自主協同。他結合Vidu Q、Vidu S、Motus及Motubrain的實踐,介紹了團隊從數字內容生成向具身行動延伸的過程,以及在跨本體適配、長程任務執行和動態決策方面的探索。在現場,駱怡航發佈了面向靈巧操作的通用世界模型Motus2。

據其介紹,新模型將觸覺信息納入統一建模,並將動作採樣、後果預測、價值評估與策略改進結合起來,使成功、次優和失敗的動作都能夠成為學習依據。同時,模型引入記憶機制,以應對遮擋、環境變化及連續操作中的狀態保持問題。駱怡航強調,靈巧操作是世界模型進入物理世界的一項嚴苛考驗。機器人接觸物體之後,需要判斷用力大小、調整方向及可能產生的後果,這要求模型形成更完整的反饋閉環。他也表示,目前相關探索仍存在不足,長期記憶、在線學習、聯合評測和高效部署等問題,仍是邁向自主智能體需要解決的挑戰。圓桌對話:世界模型是AI走向物理世界的新大陸嗎?

圓桌環節由香港大學計算與數據科學學院副院長(AI研究與技術轉移)、副教授羅平主持,憶生科技聯合創始人兼CTO、香港大學計算與數據科學學院助理教授楊言超,瞬適科技創始人、上海科技大學研究員、助理教授、YesAI實驗室負責人石野,極佳視界聯合創始人、首席科學家、通用世界模型北京市重點實驗室主任朱政,以及源策未來聯合創始人兼CEO李天羽,參與討論。嘉賓圍繞世界模型的定義、研究動因、潛在風險、適用場景及大模型發展帶來的影響,交流了各自判斷。什麼樣的系統才算世界模型?

針對世界模型與視頻生成、物理仿真器及視覺語言動作模型(VLA)的區別,一套系統至少要具備什麼能力,才真正算是具身智能的世界模型,嘉賓給出了不同側重的解釋。李天羽從廣義和狹義兩個層面作出區分:廣義上,編碼物理世界認知的模型都可以納入討論;狹義上,面向具身應用,則更應關注策略或機器人能否與模型形成交互。朱政看好視頻生成路線在數據、架構和訓練方法上的積累,同時指出,人形機器人的世界模型還需要考慮大腦、小腦與靈巧手的協同。石野認為,傳統物理仿真與數據驅動的世界模型具有互補性:前者包含明確的物理規律,後者能夠從數據中吸收更多環境變化與交互經驗。

楊言超則提出三個關鍵條件,即理解和預測未來、從數據中提取可預測的結構並形成記憶,以及依賴記憶持續學習和進化。哪些現實問題推動AI從生成走向理解?結合對大語言模型以及自動駕駛的觀察,李天羽強調,物理AI的容錯空間很小,真實部署對持續運行的可靠性提出了更高要求,這需要模型對環境形成更深入的理解。朱政結合創業實踐表示,世界模型雖然受到廣泛關注,但距離通用可用仍有差距。數據和模型規模的擴展必須同時考慮算力開支與商業可行性。石野則以機器人倒水、倒茶的任務為例指出,在固定數據上學會動作,並不意味著能夠理解新的任務要求。一旦目標或環境變化,依賴既有軌跡的系統可能繼續執行錯誤動作。

楊言超用兒童學習新玩具作比喻:模型可以生成逼真的圖像,卻未必能夠像孩子一樣,通過觀看一次演示、進行少量嘗試就學會新技能。在他看來,面對不斷變化的家庭環境,這種快速理解和學習的能力尤為重要。世界模型最可能被高估在哪裡?對於技術路線的風險,楊言超提醒,不能把生成準確等同於理解正確。他結合研究經驗指出,畫面的逼真程度並不必然對應機器人交互能力的提升,模型是否學到了對行動有用的結構,更值得關注。石野認為,世界模型的內涵和技術範式還會持續演變。引入更多模態可能提升能力上限,也會帶來計算、數據和架構設計上的額外負擔。

朱政則將商業閉環視為關鍵挑戰:世界模型能否找到明確的付費需求,並用收入和融資支持下一代研發,關係到這條路線能否持續推進。李天羽關注高質量訓練信息的獲得成本。他指出,視頻、三維、深度和觸覺等表徵並非天然低成本,如何規模化獲得低噪聲、富含物理信息的數據,是需要長期解決的問題。哪些場景更需要世界模型?圍繞世界模型是否是所有任務的必選項,楊言超提出,應重點考察試錯代價和訓練數據獲取成本。當現實試錯昂貴、數據難以獲得時,在執行前預測行動後果更有價值;而對於成本較低的簡單任務,未必需要每次決策都調用世界模型。石野補充,一些工業任務不僅採集數據昂貴,重置環境也需要較高成本,世界模型可以在這些環節發揮作用。

同時,它也有望支持機器人部署後的反饋學習與持續迭代。朱政更看重家庭等開放環境的需求。他認為,家庭任務和操作對象變化較多,更需要模型通過少量演示快速適應;對於短期內相對固定的工業或零售任務,VLA結合預訓練與後訓練已有一定解決能力,世界模型的必要性需要具體判斷。李天羽則指出,視覺世界模型在簡單、干擾較少的環境中更容易發揮優勢,複雜背景下的可靠性仍需提升。大語言模型的泛化進展會帶來怎樣的衝擊?針對大語言模型在三維理解、編程和工具調用方面的進展,楊言超認為,這為物理智能帶來了新的可能,關鍵在於如何將相關能力與記憶、持續學習機制結合。

石野表示,更強的大模型和智能體工具有望提高數據處理、研發和自動化流程的效率,但工具調用能力與機器人直接理解並執行物理任務之間,仍存在距離。朱政從產業競爭角度指出,基礎模型企業擁有較強的人才和資源積累,世界模型及具身智能創業公司需要儘快兌現技術與產品價值。李天羽認為,三維資產生成和數據清洗是大模型能夠直接提供幫助的方向。不過,機器人端側算力需要與其創造的價值相匹配,雲端大模型的技術路徑不能簡單照搬到具身系統中。讓模型能力在真實場景中接受檢驗本場論壇呈現了世界模型從研究概念走向產業實踐的多條路徑,也保留了不同技術路線之間尚未解決的分歧。

生成能力如何轉化為行動能力,數據規模如何轉化為泛化能力,以及技術投入如何轉化為可持續業務,是貫穿討論的核心問題。在論壇總結中,羅平表示,世界模型未必是通往物理智能的唯一路徑,但在賦予機器空間想象、常識推演與行動預測能力方面具有重要潛力。他代表香港大學計算與數據科學學院,邀請產業界圍繞場景驗證、聯合研發、技術轉移和生態共建開展合作,推動科研成果進入生產線和日常生活。從預測世界到可靠地參與世界,世界模型的價值最終需要在真實任務中得到證明。能否降低新場景的適配成本、從失敗中持續學習,並在長期運行中創造可衡量的效益,將成為檢驗這一方向的重要尺度。

Related

相關文章

Edge AI Daily 早報(9月19日)

Edge AI Daily2026.09.19 08:30 · 來自北京全文6222字00:00 / 17:23Anthropic與埃森哲20億美元安全合作,行業安全評估門檻形成;前FTC官員警告AI實驗室卡特爾引發市場震盪;SEC授予代幣化證券五年豁免;英國工黨推動新AI監管機構。

剛剛

達卯科技算電協同2.0平臺入選2026國際數字能源展重大成果發佈

成果中唯一聚焦算電協同全鏈路運營的AI技術產品 9月15日-17日,2026能源綠色發展大會・國際數字能源展在深圳舉辦。展會首次以“一會一展”深度融合模式打造全球數字能源產業盛會,集中發佈近百項前沿創新成果。達卯科技自主研發的「算電協同2.0平臺・AIDC綠電直連能源運營操作系統」成功入選重大成果發佈,也是成果中唯一聚焦算電協同全鏈路運營的AI技術產品。

1 小時前
全天候科技產業與商業

小鵬要把賣車和賣技術一起推向全球

王小娟 發表於 2026年09月18日 14:05 摘要:技術合作再尋新客戶。9月17日晚,小鵬集團董事長、CEO何小鵬談起G9L的價格,說自己和總裁王鳳英曾在會議室裡反覆爭論。幾小時前,這款車剛以23.18萬元的 限時起售價上市,較8月公佈的預售起售價低了2.

3 小時前

Claude“主導”Anthropic 26%的AI研發、3萬Agent同時運行:當AI開始“造AI”,頭部公司RSI路線正在分化

根據報導,人工智慧領域近期出現一項值得關注的動向:Anthropic 的 AI 模型 Claude 在其內部研發工作中扮演了主導角色,佔據該公司約 26% 的 AI 研發比例,同時有高達 3 萬個 Agent 在同一時間並行運作。這項數據反映出 AI 開始「製造 AI」的趨勢正在加速,而頭部公司在遞歸自我改進(RSI)路線上的分化也愈發明顯。 Claude 不再只是對外服務的產品,而是成為 Anthropic 內部研發流程的核心引擎。

8 小時前

智譜實現RSI最小閉環,A社:我來監督

智譜AI近日對外宣布,已在遞歸自我改進(Recursive Self-Improvement,簡稱RSI)領域取得關鍵技術突破,成功實現業界首個「最小閉環」系統。與此同時,被業內簡稱為「A社」的AI安全研究機構同步表態,將以第三方監督角色介入該系統的測試與驗證流程,確保技術發展符合倫理與安全規範。 所謂的最小閉環,指的是系統能在不依賴外部人工反饋的情況下,自主完成從自我評估、參數調整到性能驗證的完整循環。

9 小時前