硅谷今日最熱具身模型!不用後訓練,看一遍就學會

自上週Generalist發佈能夠學習3到12秒動作的具身大腦Gen 1.5 以來~ 剛剛,北美具身初創Skild AI又發佈了全新機器人基礎模型S1,直接把機器人上下文學習的任務長度拉到了10分鐘往上。這次的S1主打上下文學習(in-context learning,ICL): 無需在後訓練階段專門學習新的操作數據,只需看一段人類示範視頻,就能“照貓畫虎”,直接完成一整套從未見過的複雜操作流程。在官方演示裡,機器人完成了煎餅、沖泡咖啡、給植物換盆,以及設備組裝等長程任務。並且在未見過的任務上,把成功率幹到了66%,遠超基於語言提示的VLA(只有 9%)。
另外,哪怕是走傳統後訓練微調的路線,想追平S1只看一次演示的效果,大概也要喂進去380次左右的任務演示。非常amazing!可以說,最近這一波集中在上下文學習的工作,又給不少人重新燃起了對具身的希望。有推特網友表示,通用機器人可能兩年後就會出現,而不是七年。還有網友表示,從Rhoda,到上週Generalist,再到現在Skild S1的10分鐘任務,機器人真正的GPT時刻似乎正在出現。因為一旦這種能力真的泛化,以後開發機器人技能,可能真的會變得像給ChatGPT 寫 Prompt一樣。真有這麼神嗎?我們一起來看。
從BERT時代,邁向GPT時代 想要理解S1這次到底怎麼個上下文學習,咱們得先看看,傳統機器人是怎麼學習一個新技能的。在傳統的pipeline裡,機器人學習其實和大模型差不多: 先在海量數據上進行預訓練,學會一些基礎能力;然後到了具體場景,再針對某個任務收集數據,通過後訓練,讓機器人學會專有技能。只不過問題在於,機器人和大模型雖然流程差不多,但數據成本卻完全不是一回事。大模型的預訓練數據,大量來自互聯網;哪怕到了編程、Agent這些專門場景,很多後訓練數據也可以在線上快速獲得,甚至自動生成。但機器人就比較慘了。預訓練數據得在現實世界裡採,後訓練數據還是得在現實世界裡採。
所以,在技術博客中,Skild AI就直接開麥了: 如果一個機器人基礎模型,每學一個新任務仍然需要幾十、幾百小時真機數據,再重新後訓練,那我請問,這個“基礎模型”,基礎在哪兒?他們甚至引用已有研究指出,如果針對一個新任務的數據已經足夠多,那麼從零訓練的模型甚至都可能追平經過預訓練再微調的基礎模型。所以,具身預訓練的意義到底是啥?對此,Skild給出的答案是:上下文學習。為了有一個參考座標,Skild拉來了大模型的發展路線作為對照。早期的BERT已經很強了,但每碰到一個新任務,往往還是得重新準備數據,再微調一遍。
真正改變遊戲規則的,是後來GPT-3之後逐漸顯現出來的上下文學習能力: 不用改模型權重,只要在Prompt裡給幾個例子,模型就能臨時“學會”一個新任務。基於此,Skild認為,機器人現在其實還困在類似的BERT時代,他們真正想要的是,是讓機器人也完成同樣一次範式轉換。也就是說,預訓練真正的價值,不應該只是讓後訓練少採一點數據,而是讓機器人最終獲得“從上下文裡直接學習”的能力。上下文學習 那麼,S1這次到底從上下文裡學到了什麼?
Skild認為,真正能檢驗機器人上下文學習能力的,其實就兩個維度: 一個是,能不能學會訓練時根本沒見過的新技能;另一個是,能不能把已有技能重新組合起來,完成一個很長、很複雜的新任務。比如,機器人只需觀看一段翻煎餅的視頻,就能學會如何製作煎餅—— 即便這項技能此前從未出現在它的訓練數據中。與此同時,相較於上週Gen-1.5展示的秒級視頻,S1這次直接把上下文學習拉到了最長10分鐘。在植物換盆等任務中,每個任務都需要連續完成幾十個操作步驟。在這些長程任務的演示中,機器人不僅需要做到照貓畫虎,還需要知道: 我現在做到哪一步了,下一步該幹嘛,技能之間怎麼組合,中間搞砸了又該怎麼繼續。
也就是說,機器人需要真正理解視頻演示裡任務-動作的意圖,見招拆招、隨機應變,而不僅僅是行為克隆那麼簡單。此外,在植物換盆任務中,從開始錄演示,到機器人自己上手,只花了11分鐘,直接在效率這一塊,給傳統後訓練秒了。最後,在整個過程中,S1沒有用fine-tuning,也沒上post-training,模型權重完全不變,用同一套權重,就完成了博客裡展示的所有任務。基本對齊了大模型從Bert需要特定場景微調,到GPT-3只看演示就能完成OOD任務的跨越。唯一的不同就是,用的prompt不再是語言,而是用了能夠更好對齊下游任務的動作視頻。實驗:ICL到底是不是更能scale?
在實驗部分,Skild先在(訓練數據)見過的任務和未見過的任務上,對比了ICL視頻Prompt和傳統的語言Prompt VLA。測試結果表明,當訓練數據只有1000小時時,語言Prompt效果更好,而隨著數據規模增加,ICL開始反超。到了10萬小時,訓練時見過的任務上:ICL 96%,語言Prompt 89%。而在真正關鍵的OOD任務上:ICL 66%,語言Prompt只有9%,直接拉開了7倍以上的差距。為了驗證S1的泛化性,Skild又在不同的實驗條件下進行測試。結果表明,語言Prompt VLA的性能下降幅度,最高達到ICL的3倍。
也就是說,ICL學到的不是固定場景裡的動作復讀,而是更能跟著當前環境重新規劃怎麼做。最後,在One shot learning方面。S1在新任務上完全不做post-training,只看一條視頻演示,成功率就達到66%。相較之下,傳統VLA則大概要經過約380次演示的後訓練,才能追到同樣水平。當然,繼續堆到2000次演示後,傳統post-training最終能做到86%。所以結論可能不是“以後機器人不用訓練了”,而是: 以前一個新技能可能得教幾百遍,現在先看一遍,就能直接做到六七十分。
這也是Skild所謂的ICL scaling law: 數據越多,模型不只是會更多技能,而是越來越會“從演示裡學技能”。Skild AI是誰?Skild成立於2023年,背後站著兩個CMU機器人圈的老熟人:Deepak Pathak和Abhinav Gupta。兩人都是卡內基梅隆大學機器人研究所的教授,Deepak主要研究機器人學習、強化學習和計算機視覺,Abhinav則是計算機視覺、自監督學習領域的大神。早在2022年,兩人就合作過WHIRL,讓機器人通過觀看人類視頻進行one-shot imitation,可以說S1這條路線,也不是突然從石頭縫裡蹦出來的。
作為北美具身圈的明星企業,2024年Skild剛走出隱身模式,就拿下3億美元A輪、估值15億美元; 到了今年1月,又完成14億美元C輪融資,估值直接幹到了140億美元以上,SoftBank領投,英偉達、貝索斯等繼續上桌。兩年多時間,估值接近翻了10倍。橫向對比來看,Skild在北美具身圈的定位也相當特殊。相比於PI更像是在搞“機器人GPT”,Generalist最近強調的是one-shot learner,以及Genesis AI、Sunday最近的全棧勢頭,Skild一直強調的是一句話:Any robot,any task, one brain。
它更強調跨embodiment,希望同一個Skild Brain能夠跑在機械臂、四足、人形等不同身體上。說的通俗一點,就是想成為機器人時代的安卓:一個智能層,塞進各種不同的身體裡。這也由此決定了Skild的數據策略:全都要。Skild把機器人數據看成hardware proximity、diversity和scalability三個維度: 真機遙操最接近硬件,但貴;第一視角人類視頻最容易規模化,但和機器人身體差得遠;仿真便宜能猛造,卻又有sim-to-real gap。
所以他們對於Robot Teleop、UMI、Egocentric Video、Simulation,基本上採取的就是都用的策略。而S1的ICL,其實也是這條路線自然延伸: 2025年9月LocoFormer → 2026年2月首次In-Domain ICL → 5月第一次翻煎餅 → 8月S1發佈,直接把上下文學習推到最長10分鐘的OOD長程任務。所以現在真正值得關注的問題,可能已經不是機器人還能不能學會更多技能,而是: 機器人學習一個新技能的成本,能不能真的從“教幾百遍”,變成“你做一遍,它看一遍”。
如果這個scaling law還能繼續成立,那所謂機器人的GPT moment,可能真的不只是又一個營銷梗了。參考鏈接 [1]https://www.skild.ai/blogs/s1 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

大廠競逐AI辦公助手,蒙牛先跑出一個落地樣本
AGI-Signal2026.08.26 18:58 · 來自北京全文5756字00:00 / 17:29蒙牛讓200名業務骨幹自建AI應用。微軟Copilot嵌入Office,Google Gemini覆蓋Workspace,國內騰訊WorkBuddy、字節豆包、阿里千問辦公等密集迭代,AI辦公助手賽道持續升溫,各方爭奪的是辦公場景的桌面入口。產品能力在提升,功能覆蓋面在擴大,但在企業側究竟能跑出什麼樣的實際效果,目前能拿出完整案例的並不多。蒙牛8月中旬辦了一場AI應用創新大賽的中期路演。

面壁智能:MiniCPM 系列開源模型全球累計下載量突破 5000 萬次
作者:歸瀧 責編:歸瀧 評論: 8 月 26 日消息,面壁智能官方今日宣佈,在面壁智能四週年之際,MiniCPM 系列開源模型全球累計下載量突破 5000 萬次。注:面壁智能於 2022 年 8 月在北京成立,孵化自清華大學自然語言處理實驗室。

達卯科技與福建智算方舟達成合作,全棧式算電協同服務在閩落子
達卯科技與福建智算方舟合作,為長樂機場綜保區人工智能智算中心(一期)提供全棧式算電協同服務,涵蓋建設諮詢、平台部署、儲能電站運營及智能運維等全生命週期鏈條。該中心一期規劃15000P算力,將填補東南沿海高端智算供給缺口,並帶動區域數字產業發展。

全棧AI,其實是個陷阱?
字母榜2026.08.26 13:32 · 來自北京全文8282字00:00 / 23:43All in AI並不是終點。文 | 字母榜全棧AI,現在差不多已經成為大廠的標配。幾乎所有科技巨頭都在同一個方向使力:把AI產業鏈上越來越多的環節收入自己手裡。於是模型公司操心芯片、數據中心和電力;雲廠商開始訓練自己的模型;手機廠商在補AI能力;社交平臺也在押注Agent和下一代終端。OpenAI可能是今天“全棧AI”野心最明顯的公司之一。

養老社區裡的AI試驗
鵬程說2026.08.26 13:07 · 來自廣東全文3566字00:00 / 11:17人工智能進入產業實際場景,需要與業務流程、專業人員和組織體系深度融合。長壽時代,養老行業正在進入一個更復雜的供給階段。民政部、全國老齡辦近日發佈的《2025年度國家老齡事業發展公報》顯示,截至2025年末,我國60歲及以上人口達到3.2338億,佔總人口的23%;65歲及以上人口達到2.2365億,佔總人口的15.9%。

Codex 負責人 Tibo:OpenAI 的遞歸式自我改進,從基礎設施優化開始
OpenAI 如何用 AI 改進 AI 在 Matthew Berman 最新一期訪談中,OpenAI 產品負責人 Tibo 圍繞 Codex 的發展、個人 AI 智能體、模型效率提升與遞歸式自我改進,分享了他對下一波人工智能浪潮的判斷。Tibo 詳細介紹了 OpenAI 如何推動 ChatGPT 與 Codex 合併,打造能夠理解用戶目標、日常工作和個人偏好的通用智能體;也解釋了超高速模型將如何改變開發者的工作方式,讓 AI 能夠與人保持同步,甚至在部分任務中快於人類。