SeeAct AI穆堯:具身智能終局,一定是從“被訓練”走向“自我進化”|物理AI50人

2026年9月24日 17:19
SeeAct AI穆堯:具身智能終局,一定是從“被訓練”走向“自我進化”|物理AI50人
站內 AI 整理稿

本文作者: 李秋悅 2026-09-24 17:19 導語:機器人真正缺的,不是數據,而是經驗。機器人真正缺的,不是數據,而是經驗。作者:李秋悅編輯:吳彤那是具身智能最荒蕪的時候。沒有成熟數據集,沒有標準Benchmark,甚至沒有一條被驗證能走通的技術路線。穆堯南下港大讀博,開始研究具身智能。2021年,穆堯進入HKUMMLab,成為該實驗室創始人羅平教授和中國人工智能奠基人之一的湯曉鷗教授共同指導的學生。“具身智能會是一個非常 Promising 的方向。”剛入組時導師們的這句話,穆堯一直記到今天。四年後,這個方向的潛力,開始在穆堯自己的研究中得到印證。

穆堯主導的RoboTwin,成了中國具身智能圈的事實標準之一,GitHub斬獲超過 2900 顆星,螞蟻集團的LingBot-VA、生數科技的Motubrain都搶著在這個基準上刷新成績。他本人入選國家級青年人才計劃,成為上海交通大學長聘教軌助理教授,谷歌學術引用超過 5000 次。2026年,穆堯做了一個更激進的選擇:押注“具身自我進化”,創辦SeeAct AI觀行智能。他給出一個相當明確的判斷:“具身的終局一定會邁向獎勵驅動的自我進化。”這個判斷,和他2018年在清華讀碩士時堅持的東西一脈相承。那一年,自動駕駛行業還在把感知、規劃、控制拆開做,穆堯堅持端到端Policy和獎勵驅動。

後來,特斯拉FSD把整個行業收斂到了端到端,再也沒人問他這是不是主流方案。穆堯把這種堅持歸結為一個詞:taste。這裡我們理解不僅是技術品味,更是洞察技術發展的科學直覺。那麼穆堯為什麼會有這樣的直覺?以下是左林右狸頻道與穆堯的對話,在不改變原意的基礎上做了部分編輯:01 獎勵驅動從未離場左林右狸:你第一次系統接觸強化學習是在什麼時候?穆堯:2017年。當時David Silver在YouTube上有一套很好的強化學習課程,我也系統學習了圖靈獎獲得者Sutton的《Reinforcement Learning》。

那個時候爆發的是圍棋智能,我看到Alpha Go通過獎勵驅動、自我規劃、自我推演,最後能夠產生超越人類的智能。我當時覺得,這可能就是人工智能皇冠上的明珠。左林右狸:到了清華做自動駕駛以後,這種判斷怎麼進入你的研究?穆堯:2018年的時候,我比較篤信兩件事情。第一是端到端的Policy。第二是獎勵驅動,希望由神經網絡來承載這個策略。但是那個時候這個觀點還比較超前。自動駕駛整體上分得比較開,感知、決策、規劃、控制是分開的,甚至一個公司裡面都會分成不同事業部。我還是希望用神經網絡來承Policy,希望直接由視覺反饋和獎勵驅動來做這件事情。

後來做Mixed Reinforcement Learning,也是希望搭建Model-based RL和Model-free RL之間的橋。Model-free更多依賴真實數據,真實世界交互代價比較大;Model-based可以提高樣本效率,但是模型自身會有預測誤差。所以我們希望根據不斷得到的環境反饋,對模型和現實之間的誤差進行建模,再不斷更新決策系統。左林右狸:為什麼後來從自動駕駛轉到具身智能?穆堯:碩士階段我有一個感覺,車雖然也是一個具身智能體,但是它的限制比較大。本質上就是四個輪子在道路上跑,不撞人、遵守交通規則,道路類型和動作空間都比較有限。

我就在想,有沒有一個更廣闊的領域,可以做更多有趣的探索。所以2021年,我去了香港大學MMLab羅平老師組裡做具身智能。具身智能的研究對象一下子打開了。末端執行器有夾爪、靈巧手,機器人有雙足、四足、輪式、雙臂、工業臂。我當時覺得,這個領域太好玩了,有太多問題可以研究。左林右狸:剛進入具身智能的時候,你首先在解決什麼問題?穆堯:2021年的時候,具身智能領域可以說非常空白。幾乎沒有成熟的數據集,也沒有標準Benchmark。到了2023年,大模型、ChatGPT 出現以後,機器人處理複雜長程任務的能力上限一下被推高了。我們那個時候做了EmbodiedGPT。

後來又做RoboCodex,通過上層大模型做任務拆解,再生成底層代碼,調用具體接口,連接機器人執行器。我們當時比較強調視覺反饋,因為物理世界不是純文字世界,一定需要視覺,甚至需要三維信息。左林右狸:RoboTwin 是怎麼從這條線上長出來的?穆堯:後來我們把代碼生成用於構建仿真合成數據。那個時候很多仿真器還是比較笨重,我們希望做一個足夠方便,學生在自己的遊戲本上也能夠跑起來的機器人引擎和仿真數據管線。所以有了RoboTwin 1.0,從場景生成、任務生成、數據生成,到對早期Policy Model做Benchmark,形成一套比較完整的流程。RoboTwin 2.

0 以後,又把任務Scale Up到50左右,同時升級了行為生成和代碼生成,它的核心定位是Benchmark和數據生成器。到了3.0,我們和摩爾線程合作,進一步支持國產顯卡和國產物理引擎。當然也不是說只侷限在國產,我們希望RoboTwin是一個更大的生態,不同顯卡、不同引擎都能夠接進來。左林右狸:RoboTwin 2.0之後,為什麼又開始做VLA?穆堯:代碼生成這條線做得比較完善以後,我們進一步思考它的瓶頸是什麼。本質上的瓶頸,是最底層API的可擴展性。最底層API還是工程師寫的。那我們就在想,這些API能不能變成數據驅動?能不能是端到端形式?能不能由神經網絡作為載體來承載?

這其實又回應了我從碩士階段開始的一些研究理念。所以從那個時候開始,我們進一步做具身基礎模型。到了後來,我的研究基本上形成了兩類,一類是端到端策略基礎模型;另外一類,是以代碼生成為主的一套Agent System。左林右狸:這兩條線最後怎麼合起來?穆堯:我覺得一個歷史機遇是,當端到端模型的成功率已經達到比較可用,或者至少展現出比較好的潛力以後,就可以把端到端模型作為一個Skill嵌入Agent System。上層 Agent 負責複雜任務推理和任務拆解,底層端到端模型,則作為一個可擴展、泛化能力比較好的Skill被調用。

所以後來我們進一步做了完整的Agent System,包括和智元合作發佈的RoboClaw。到RoboClaw這個階段,我覺得基本上把我從2021年開始對整個系統的一些設想實現了。今年9月10日教師節,穆堯和他的學生們(抱花者為穆堯)02 具身智能scaling關鍵要經驗規模化左林右狸:你認為什麼是真正的具身智能scaling?穆堯:我這裡定義了三層。前兩層,現在具身智能競爭得已經比較白熱化,大家做得如火如荼。比較基礎的是Scale up Data和Scale up Model,也就是數據量、模型規模都要繼續擴大。

我覺得第三點是目前所有人都做得不夠好的,叫Scale up Experience,經驗規模化。就像我們人一樣,人就是一個很強的具身智能體。我們每天都在物理世界當中交互,從嬰兒的時候不會走路,到會走路;從什麼東西都不認識,到後來能夠操作各種物體。比如一個人進電子廠,一開始可能一個儀器都不認識,最後變成熟練工。我們找工作的時候,大家會看什麼?工作經驗。所以我覺得經驗的規模化,是真正把智能性繼續推高非常重要的一步,也是真正能夠推動具身智能走向落地化、實用化的關鍵一步。左林右狸:為什麼在Data Scaling和Model Scaling之外,還需要單獨提出Experience Scaling?

穆堯:Data Scaling關注訓練數據規模的擴大,Model Scaling關注模型規模的擴大。Experience Scaling更強調的是,機器人能不能在與環境的交互中,持續產生對自己有用的新經驗。如果數據主要來自人類演示,那麼機器人學到的更多是“人在這些情況下會怎麼做”。但機器人自己執行時會遇到什麼問題、採取不同動作會有什麼結果、失敗以後應該怎麼調整,這些情況還需要它自己去經歷。比如擰瓶蓋,人演示的時候,可能抓住以後很順利就擰開了。但機器人自己做,可能抓的位置偏了一點,也可能發生打滑。它需要根據實際反饋,判斷下一步是重新抓、調整力度,還是換一種方法。

這些交互當然也可以記錄成數據,用來訓練模型。所以經驗和數據並不是截然分開的。我強調Experience Scaling,是因為我們需要建立一種能夠持續產生經驗的機制:機器人遇到當前不會的問題,可以自主探索,把嘗試的過程和結果積累下來,供後續學習複用。而且隨著能力提升,它應該能夠接觸更多場景、嘗試更復雜的任務,獲得更豐富的經驗。所以這裡要規模化的,既包括交互的數量,也包括經驗覆蓋的範圍,以及這些經驗對能力提升的價值。左林右狸:具身自我進化和Experience Scaling之間的關係是什麼?

穆堯:可以簡單理解為,Experience Scaling解決經驗從哪裡來,自我進化解決這些經驗怎麼轉化成能力。機器人需要先持續產生足夠豐富、有價值的交互經驗,但經歷得多,並不意味著能力一定會提高。中間還需要評價和學習的過程。我們強調獎勵驅動,就是希望通過任務結果和環境反饋,讓系統判斷哪些嘗試更有效,再據此改進自己的策略。這種改進可以發生在不同層面。底層是具體操作,比如怎麼抓、怎麼調整接觸位置,可以通過訓練更新策略模型;上層是任務規劃和決策,比如什麼情況下應該換一種方法、調用哪個Skill,也可以通過總結經驗、更新記憶和技能來改善。

關鍵是,一次交互帶來的收穫能夠被保留下來,並在後續任務中發揮作用。左林右狸:那為什麼還要專門提出“遞歸自我進化”?它和一般的自我進化有什麼區別?穆堯:遞歸自我進化,也就是Recursive Self-Improvement,是說我進行一輪提升以後,可以Rollout(自主執行)出更多經驗,而且這些經驗會比上一輪更好。比如一個學生,一開始只能解決基礎題60分。當他達到60分水平以後,再去做一些新的題,可能七八十分的題也能夠做出來,於是就有一輪新的經驗。在新一輪經驗基礎上,策略再繼續往前演化,然後又可以Rollout出更新的經驗。所以這是一個遞歸的過程。

能力提升以後,會產生新的、更高質量的經驗;新的經驗又繼續推動能力提升。智能能夠持續演化,優質經驗能夠不斷 Scale Up,這就是具身的遞歸自我進化。左林右狸:具身自我進化和強化學習是什麼關係?穆堯:強化學習是自我進化的工具之一,但不是唯一,因為需要進化的是長序任務推理、具體執行等多個維度。強化學習可能更多驅動策略,也就是端到端策略的進化。但是對於一些經驗總結,我完全可以以文檔的形式存儲下來,這相當於是智能體層面的進化。所以本質上,具身自我進化需要的是策略基座,或者整套系統協同進化。左林右狸:自我進化在預訓練到後訓練的整個流程上,是什麼樣的位置?

穆堯:我們希望自進化系統覆蓋從預訓練到後訓練的完整流程。首先在預訓練階段,需要給策略基座嵌入自主糾錯的基因。也就是說,要匯聚來自不同機器人、不同場景、不同任務的自主糾錯經驗,把它統一訓練進策略基座。這樣到了一個新的場景做後訓練的時候,它才能非常高效。類似的道理,比如π₀.₅,大家對它的評價是視覺泛化性非常好,因為人家的預訓練就嵌入這種視覺泛化。來了一個新場景,可能長得不一樣,需要那幾條數據fine-tune (微調)一下,但是很快就可以適應。對應自主糾錯,從運行skill level的角度來說,我們希望嵌入比較好的自主糾錯經驗。

對應地,需要產生規模化的經驗數據,也就是剛才講的scaled experience data。這相當於預訓練階段乾的事情。後訓練階段則是面向用戶真正的目標場景,是一個完全陌生的場景。策略需要真正執行,然後通過交互和反饋,快速達到用戶滿意的標準。左林右狸:可以用一個具體任務,講機器人如何完成從失敗,到判斷原因,再到探索新方法、學會新能力的過程嗎?這種自主糾錯是什麼樣的流程?穆堯:我舉一個比較適合自主糾錯的例子,比如擰瓶蓋。預訓練階段,需要讓模型見過各種各樣的情況。因為專家數據只會提供:我按照這個角度去做,最後瓶蓋順利旋開。但是機器人自己執行的時候,可能擰一下沒擰開。

這個時候,它需要知道怎麼繼續嘗試。比如能不能感知靜摩擦力、動摩擦力什麼時候發生變化?什麼時候能夠判定瓶蓋真正克服了靜摩擦力,可以簡單旋幾下給它擰開?這種能力的引入非常重要。所以預訓練階段要見過千奇百怪的情況:一開始沒有按照預想的狀態走,這種情況下怎麼克服、怎麼調整。這種經驗會在預訓練階段沉澱下來。到了後訓練階段,比如遇到一個完全沒見過的物體:一個純黑色的冰箱,也沒有把手。機器人不知道是從左邊開,還是從右邊開。那就先試左邊,發現使勁也打不開,再去試右邊。本質上是能夠自主自發地嘗試、自主試錯,再根據試錯以後的環境反饋做策略調整和更新。同時這種試錯不是無限制的。

系統還需要能夠分析獎勵和反饋,知道哪些方向沒有必要繼續嘗試。如果這個東西掰不開,還非要使一百牛的力去掰,那機器人可能就壞了。左林右狸:你認為我們離真正的具身scaling還有多遠?穆堯:說遠很遠,說近也很近。說遠,整個技術在飛速發展。現在這些模型,比如大家覺得很驚豔的Generalist GEN-1.5,可能在完全沒見過的場景下,給你一條數據,一個 in-context 的方式,就能有58%的成功率。這從學術上來說非常amazing,但58%,距離99.99%還有很遠。說近也很近,真正需要找到的是Scaling的槓桿。

以前大家覺得具身智能的數據很難Scale Up,2024年、2025年,很多具身智能的報告開篇都在講數據短缺,但當大家找到像UMI、手持式夾爪這種比較合適的數據採集方式以後,你會發現到百萬小時的速度比很多人的預期快。所以重點就來了,怎麼樣找到Scale up Experience的方式?如果完全依賴真機自主試錯,當然真實世界的數據最優質,但要保證多樣性、保證並行度,成本會非常高,而且比遙操作還高。我們提出的方案,是在構建得足夠好的虛擬空間裡,由獎勵驅動進行自主試錯,通過這樣的方式不斷積累經驗。

穆堯在世界機器人大賽WRC 202603 仿真是經驗規模化的槓桿左林右狸:經驗的Scale Up,主要靠真實數據還是仿真數據?穆堯:我們的思路是少量真機,加大量虛擬空間當中生成的數據。真機數據,我指的是真機交互,即機器人真實的自主推理交互。把它扔在真實世界當中,rollout policy所產生的真機數據,類似於π₀.₆和π₀.₇所採用的這種數據。大家對“仿真”的定義可能不完全一樣。有人講仿真數據,特指物理引擎。但是現在還有另外一種範式,就是用神經網絡驅動一個通用、可擴展的World Engine。它本身也是根據真實數據訓練出來的,所以生成的數據會越來越逼近真實世界。

在我的概念裡面,由物理引擎產生的數據、由World Model或者World Engine 產生的數據,以及真實世界機器人自主交互的數據,可以看成來自三個不同的“平行宇宙”。只要能夠提供充分的自主決策經驗,都可以匯聚在一起。預訓練本來就是希望匯聚越來越多的經驗。左林右狸:為什麼是少量真機?物理仿真引擎和真實世界的物理參數之間的差距(sim to real gap)怎麼解決?穆堯:來自真實世界的數據沒有sim to real gap,這一點不可否認。但如果真正要Scale Up Experience,就需要足夠的多樣性和並行度。純靠真機自主試錯,代價依然很大。

所以現在很少有人還在講純寫真機遙操數據。大家在做的可能是一些更廉價化的方案,比如UMI的數據,包括頭戴式的egocentric human數據。物理仿真引擎和真實世界的物理參數嚴格吻合,目前來講還是懸而未決的一點。但我的觀點是,為什麼一定要和真實世界吻合?本質上,我們可以認為仿真世界是真實世界的另外一個平行宇宙。你說在這個世界上摩擦力是0.2,我在那個世界裡面摩擦力是0.3,那我在這個世界學到的知識就不是知識嗎?我覺得依然是知識。它的規模化依然可以帶來模型智能的顯著提升。當然大家確實更關注如何遷移到真實世界。但我覺得現在這個路線上已經有很多,比如蘇度科技(Sudo),做了很好的驗證。

基於仿真世界裡面,至少抓取這件事情,他們解決得非常好,要比無數“數採場“採出來的數據訓出來的抓取的模型還要好。這一點上,我還是充分相信仿真的力量。左林右狸:虛擬空間靠什麼搭起來?穆堯:現在有兩條路線,一條路線是把物理仿真引擎做得足夠好;另外一條路線,是希望能夠用World Model支撐一個可交互的物理世界。World Model 目前在一些嚴格物理規律上還有能力邊界,但它很有潛力的一點是可擴展性非常強。物理引擎過去的問題,是擴展一個新的場景、新的任務,需要大量工程師投入。但現在有Coding Agent 以後,這部分也發生了很大變化。所以現在相當於有兩個很強的工具並駕齊驅。

一邊是生成式World Model,另外一邊是由生成式AI輔助構建物理仿真。最終都是希望得到一個足夠好的虛擬空間,在裡面低成本試錯,讓經驗不斷Scale Up。左林右狸:那真實數據和仿真數據分別最適合提供什麼?有沒有一個最佳比例?穆堯:沒有一個固定答案。真機和仿真數據的配比,會隨著模型能力和模型結構不斷變化。比如模型只是對背景的泛化能力不好,但操作本身已經比較好,那多補一些仿真生成的背景增廣數據,可能非常有效。但如果做鑰匙開鎖這種任務,對真實物理接觸要求非常高,那來自真實機器的反饋可能就更重要。所以數據的來源、數據的配比,需要和模型能力、模型評測結果匹配。

左林右狸:真實生產不能允許機器人無限試錯。到了實際部署階段,真實世界和虛擬世界怎麼配合?穆堯:大量試錯一定要放到虛擬空間裡,但真實世界仍然要不斷提供反饋。通過虛擬空間裡的大量試錯以及 Agent 的分析,要能夠反過來發現:還有哪些東西是虛擬空間模擬不足的,需要補充真實世界的交互。到了後訓練階段,面對一個完全分佈外的新場景,真實機器的Rollout和虛擬空間裡的試錯可以並行進行。真實世界負責提供最關鍵的物理反饋,虛擬空間負責把這些問題進一步展開,做更大規模的探索。

穆堯在《無限演化》世界模型專場現場04 模型要為獎勵驅動而設計左林右狸:如果最終目標是獎勵驅動的自我進化,對策略基礎模型本身有什麼要求?穆堯:這個也是我們做具身基礎模型的時候一直在考慮的問題。現在VLA、World Action Model很卷,可能一個星期出來很多篇。我們會想,我們投入這麼大的精力做一個模型,目標到底是什麼?差異化在哪裡?我個人的判斷是,具身的終局一定會邁向獎勵驅動的自我進化。所以我們反過來問,有沒有一個足夠好的模型結構,既有足夠強的性能,又足夠高效,能夠支撐後面的獎勵驅動學習?這也是我們後來做離散擴散VLA的一個出發點。左林右狸:為什麼選擇離散擴散?

穆堯:當時主流的一些路線,比如π系列,是連續擴散或者流匹配。這種方式對複雜動作軌跡的生成能力很強,但是拿去做強化學習的時候,策略優化比較複雜。所以我們就在想,能不能繼承這種對複雜動作軌跡的生成能力,同時讓後面的獎勵優化更加簡單。我們後來總結,擴散模型生成複雜動作軌跡的能力主要來自兩點:全局視野和迭代優化。全局視野是說,在生成整條動作軌跡的時候,各個位置之間可以相互關注。比如前面正在接觸物體的時候,就可以考慮最終希望到達的姿態。迭代優化,就是一步一步把整條軌跡修得越來越精細。後來我們發現,離散擴散同樣具備這兩個特點。

同時它又是詞元預測,模型輸出的分數能夠比較直接地計算,所以可以比較方便地適配PPO(近端策略優化)、GRPO(組相對策略優化)這些強化學習方法。所以我們做了離散擴散VLA。左林右狸:從離散擴散VLA到MM-ACT、dVLA-RL,後面的研究是在繼續解決什麼問題?穆堯:進一步就會問,離散擴散能不能用來做世界模型?能不能把語言生成、視頻生成和動作生成統一起來?所以後來做了MM-ACT,希望把這些合併成一個統一模型。我根本不認為VLA和World Action Model最終是兩條完全不同的路線。

未來一定會是一個更加統一的模型,它既能夠做語義理解和推理,也能夠對未來進行視頻或者隱藏視覺特徵層面的推演,同時還能夠生成Action。再下一步,就是對訓練得足夠好的基礎模型做強化學習。我們更關注的是,多任務、多場景能不能一起訓練。現在很多強化學習工作,是一個策略在一個單一場景裡做後訓練。訓練完以後,換到另外一個場景,泛化能力可能又大打折扣。所以我們希望不同場景、不同任務的數據能夠匯聚起來,進行更加高效的強化學習,後來就做了dVLA-RL。歸根結底,真正需要討論的不是名字叫VLA 還是World Action Model,而是這個策略基座到底應該嵌入什麼能力。

我們看到更大的問題,還是自主推理、自主糾錯能力的缺失。左林右狸:除了能不能自我進化,VLA 真正部署到機器人上還有什麼現實限制?穆堯:一個很現實的限制就是推理代價。模型太小,沒有足夠的智能性和泛化性;模型做大了以後,自然會產生推理時延。比如World Action Model,把Video Generation和Action Generation 做聯合。Video Model 為了讓泛化性足夠好,體量會比較大。體量一大,推理代價和推理時延都會比較長。所以我們希望,它推理一次能夠對應未來多個Action Plan,而不是每一個動作都重新跑一次大的視頻模型。這就需要異步、異頻處理。

但是異步以後又會出現另外一個問題,慢腦Video Generation 更新頻率比較低,它推演的時候依據的是之前的觀測,真正執行的時候,現實世界已經往前走了。所以還需要具備實時更新能力的模塊,根據最新觀測不斷修正,緩解這種Delay,把模型推演和真實世界之間的時間錯位儘量消掉。左林右狸:機器人不斷自主試錯之後,產生的這些經驗最終怎麼沉澱和複用?穆堯:我覺得一個機器人連續工作以後,至少需要記住幾塊。一個是場景,一個是自己做過什麼,第三個,也是最重要的,是自己產生的經驗。比如人進工廠也是要培訓的。但是培訓兩天以後,後面還會在這個崗位上越做越熟練。本質上記住什麼?

不是簡單記住自己做了多少次,而是我在什麼情況下會觸發什麼樣的邊界問題?遇到這些問題應該怎麼解決?所以這是對過去探索、交互經驗的總結,對知識的提煉、對技能的提升。沉澱下來的東西形式可以很多。可以是一些文檔,是對場景的文字描述或者圖片;也可以沉澱成模型權重,作為一個Skill。上層Agent 需要知道什麼時候去調用這些東西。所以並不是把所有過去軌跡原封不動地存下來,而是要做動態的記憶維護。短時的信息,任務完成以後可以清除;但真正總結出來的知識和Skill,需要能夠長期保存,在未來遇到類似問題的時候重新調用。

穆堯在中國計算機學會(CCF)秀湖會議上演講05 具身自我進化終結項目制左林右狸:為什麼這一輪具身智能裡面,很多高校成為連接企業的重要節點?企業真正需要高校提供什麼?穆堯:我覺得有兩個方面。第一,具身智能整體來說學術前沿性非常強,非常需要科學家來定義。這個產業需要來自科學家更前沿的視野。如果缺少這樣的判斷,很容易沿著一條已有路線瘋狂Scale Up,比如一直採真機遙操作數據。但這個範式是不是最後的主流?怎麼樣保證數據多樣性?成本最終是多少?這些都需要更加前沿的技術判斷。第二,高校本身就是高質量年輕人才的蓄水池。現在真正走在人工智能最前沿的,很多都是非常年輕的學生。

這一代年輕人是AI Native的一代,他們在學習、工作、編程的各個環節都已經大量使用 AI,所以在理解新的人工智能範式、構建新的研究方向時,可能會產生很多新的東西。左林右狸:這一輪具身智能裡的高校和企業分工,和上一輪自動駕駛時代有什麼不同?穆堯:我覺得完全不一樣。自動駕駛時代,高校獲取真實數據非常依賴企業。車廠的大規模真實數據,高校很難拿到,同時高校也缺大規模算力,所以很多時候只能在公開數據集上研究。具身智能不一樣,很多具身數據的獲取門檻沒有自動駕駛那麼高,企業和高校之間的數據也相對更開放。

所以高校可以更多提供前沿模型的Know-how、數據標準、數據清洗管線、新的模型結構,以及 Agent 和端到端模型結合的新範式。企業負責做真正的大規模化,數據Scale Up、模型 Scale Up、大規模訓練,然後進入真實場景部署。左林右狸:現在大家都圍繞VLA、世界模型競爭,為什麼選擇在這個節點all in具身自我進化?穆堯:我覺得現在真正缺的,不是再多一個模型名字,而是找到下一階段的Scaling槓桿。過去幾年,人類演示數據的採集方式已經進步非常快,不管是手持設備、遙操作還是UMI,大家都在想辦法把專家數據做得更多、更便宜。但它們解決的主要還是“人會怎麼做”。

機器人自己執行時遇到失敗怎麼辦,哪些動作看起來合理但實際不成立,怎樣從反饋裡找到新的解法,這類經驗目前仍然非常不足。這個時候,我覺得繼續單純放大人類演示數據的邊際收益會越來越有限。下一步真正值得Scale的,是機器人自主產生的經驗。現在也已經開始出現一些信號。比如 Physical Intelligence 的 π*0.6 和 π0.7,都非常嚴肅地在討論經驗數據怎麼進入模型。當然他們走的是純真機路線,用真實機器直接收集自己推理產生的經驗。

我們選擇在這個節點出來創業,本質上是希望把這件事情從一個研究問題變成一套真正可以持續運行的系統:怎麼產生經驗、怎麼評價經驗、怎麼把經驗重新訓練進模型,再讓模型進入下一個場景繼續進化。左林右狸:SeeAct現在希望交付給客戶的到底是什麼?穆堯:我們交付的是一整套東西。包括端側算力平臺、基礎模型。基礎模型裡面包括World Model、Policy Model、Reward Model,還有完整的Agent System。整個產品形態會結合硬件和軟件,比如以工控機這樣的形式交付。最大的區別是,別人交付的是一個寫死的Policy,我們希望交付的是一個能夠持續進化的Policy。

它不是交付完就結束,而是賣出去以後,還能夠針對用戶自己的場景自主進行定製化能力提升。所以第一是可擴展,第二是能夠持續自主進化。左林右狸:如果策略基座真的具備很強的自主糾錯能力,你覺得它首先會改變具身行業的什麼?穆堯:會改變整個具身行業的交付方式。以前包括上一代AI,很多模式都是項目制。接一個單、接一個場景,可能20多個工程師在那裡耗三個月,把這個場景交付掉。到了下一個場景,可能又不行。我們希望達到的是,有一個具備很強自主糾錯基因的模型,再配合一套自進化系統。到了一個新場景以後,它可以快速適應、不斷提升。我們的目標,大概是一兩天、48小時左右,自主提升到用戶可用的狀態。

這樣同樣一套系統、同樣一種供給形式,就有機會變成一個標準化商品。客戶的場景可以不一樣,但把它買回去以後,可以通過自進化體系在自己的場景裡達到想要的效果。我覺得只有這樣,具身企業才有可能產生足夠的毛利率,真正靠產品活下去,而不是永遠靠大量工程師做項目、靠融資。左林右狸:具身自我進化的產業化,什麼場景最適合先驗證?穆堯:不同場景都可以。工業、家庭,或者酒店、餐飲這些介於工業和家庭之間的場景,都可以驗證。但如果要產生規模化產業價值,我還是覺得工業場景會更合適。第一,工業場景非常適合“進化”這件事情。工業有節拍要求,不是機器人能把任務完成就夠了,還要越來越快。

人也是一樣,小孩寫作業、抄課文,會越寫越快。你看100個人怎麼抄課文,也不代表你自己就能抄得很快。最後還是要自己不斷練習。而且這件事情非常適合獎勵驅動,做得越快,得分越高。第二,工業場景相對更標準。家庭裡面需要進化的目標幾乎是無窮無盡的。一個星期家裡可能就會出現很多新東西、新衣服、新的外賣盒子,各種形狀都有。這種非標準化,很難做規模化驗證。工業也需要很強的泛化能力,但是它的泛化目標是在一個相對圈定的範圍裡。所以作為Day One去驗證整個系統有沒有威力、有沒有效果,我覺得工業更合適。當然最終我們希望自進化系統能夠進入整個人類社會,不侷限在工業,也包括家庭、商超、餐飲、酒店。

寫在最後穆堯創業以後,聽到過不少難聽的話。有人在社交媒體上質疑“具身RSI”,認為這不過是包裝出來的新概念,自我進化太遠、遞歸自我提升太虛。在一個VLA、世界模型已經足夠擁擠的市場裡,再造一個詞,“本質騙錢”。如果只看2026年,“具身自我進化”確實很像一個突然冒出來的創業故事。但把時間往回撥,會發現他其實圍著同一個問題轉了很多年。2017年,他從AlphaGo裡相信獎勵驅動;2018年做自動駕駛,在行業還把感知、規劃、控制拆開的時候,他堅持端到端Policy;後來到港大,從具身Agent做到RoboTwin,再做到VLA和強化學習。

今天他說Experience Scaling,說機器人不能永遠學習人類給出的正確答案,而應該自己試錯、糾錯、積累經驗。名詞一直在變,穆堯想解決的問題沒有變:讓機器從“被教會”,走向“自己學會”。(公眾號:) (歡迎添加作者微信擴列:lqy4605)我們歡迎所有能為左林右狸提供新觀點新角度新信息的群友,加入

Related

相關文章

智東西模型更新

DeepSeek被曝衝刺5000億元估值!年化營收達67億

(公眾號:zhidxcom) 作者 | 江宇 編輯 | 李水青 9月24日消息,據外媒The Information今日報道,兩名直接知情人士透露,DeepSeek目前的年化營收運行率已經達到10億美元(約合人民幣67.13億元),較幾個月前不足5億美元的水平翻了一倍以上。 這一最新數據被曝是由DeepSeek創始人兼CEO梁文鋒在近期一次投資者會議上披露。近期模型漲價疊加持續增長的市場需求,共同推動了DeepSeek營收提升。 與此同時,據The Information報道,DeepSeek正在敲定新一輪融資,計劃最晚於今年10月底完成新一輪500億元人民幣融資,目標估值為5000億元人民幣。其上海科創板IPO籌備也在同步推進。 在此之前,DeepSeek今年6月剛剛完成約500億元人民幣融資,投後估值近4000億元人民幣。結合路透社此前報道及企查查平臺信息,在這輪融資中,DeepSeek創始人梁文鋒個人出資200億元人民幣,騰訊出資100億元人民幣,寧德時代出資50億元人民幣。騰訊和寧德時代由此成為DeepSeek最大的外部股東。其股東陣容還包括國智投、網易、京東、正心谷資本、拾象科技、Monolith礪思資本、IDG資本等。 目前,DeepSeek官方API目前有兩款主力模型:旗艦版DeepSeek-V4-Pro-0813和輕量版DeepSeek-V4.1-Flash,二者均採用峰谷分時定價。其中,DeepSeek-V4-Pro自2026年8月17日起高峰時段漲價,而V4.1-Flash於9月10日發佈時進一步降價,較上一代Flash模型同項價格下降約60%。 據The Information報道,此次漲價令DeepSeek客戶使用模型的成本提高至此前的2.3倍至4.5倍。不過,梁文鋒在投資者會議上被曝透露:“漲價並未導致客戶數量下降,用戶需求依然強勁。”

剛剛

Kimi K3.1十月或壓軸登場:三檔推理強度、百萬超長上下文,Agent與Swarm全塞進配置

多家消息源指稱,Kimi K3.1正悄悄在內部成型,預估最快下個月(2026年10月)就會正式登場,並一口氣帶來Low、High、Max三檔可調的推理強度。最先露出馬腳的是月之暗面內部的JSON與API響應。爆料人@MaxForAI於9月23日在X平臺發帖,從截到的內部片段裡扒出了"k3d1-agent"這類模型標識,裡面還夾帶著Agent模式、應用場景和若干配置開關。

剛剛

華為小藝Work正式上線:7×24小時養成系助理,支持一句話做PPT與數據分析

能力層面,小藝Work覆蓋市場調研、文檔處理、PPT製作、數據分析、內容創作、代碼開發等場景。使用時用戶只需提出目標,產品即可自主拆解任務、規劃執行步驟,並調用合適工具推進;執行過程中用戶可隨時查看進度,並在關鍵節點進行審核和確認。針對研究分析、內容創作、編程辦公等不同任務,小藝Work還能自動匹配相應專家能力協同完成。

剛剛