自進化WAM來了!清華AIR聯手域變換提出具身In-Context Causal Learning

參數凍結,能力暴漲 Zeva團隊 投稿 | 公眾號 QbitAI 模型不更新,能力卻持續增長。這是Zeva最反直覺的地方,也是清華AIR與域變換聯手給出的新答案。在多個典型具身基準任務上,將凍結模型的累計成功率從26%提升到73%;在真實化學實驗室,機械臂在多次嘗試中越用越穩。更關鍵的是,一次人類演示就能讓模型“學會”一個新操作。Zeva是首個實現In-Context Causal Learning(ICCL)的具身WAM。它讓模型可以在不更新權重的情況下,從自己的交互經驗中持續學習。當這種能力逐步成熟,具身智能將迎來屬於自己的“GPT時刻”。
項目信息 項目名稱:Zeva 發佈機構:清華AIR、域變換 論文題目:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation 項目主頁:https://air-embodied-brain.github.io/Zeva/ 具身模型的自進化,為什麼過去很難?具身智能的真正瓶頸,是“模型到了現場能不能越做越好”。傳統思路里,想讓機器人適應新環境,通常要重新採集數據、微調模型或做test-time training。但這些方法依賴梯度更新,速度慢、成本高,還可能在適應新任務時破壞已有能力。
另一類in-context learning方法可以讓模型根據演示或任務描述調整行為,但主要解決“任務理解”,並沒有讓模型從自己的動作後果中學習物理因果。從“任務泛化”到“因果遷移” 過去我們談跨域,更多是sim-to-real、跨本體遷移、跨任務泛化。這些方法大多依賴數據對齊或表徵對齊,本質上是在不同域之間搬運“任務經驗”。Zeva更進一步:它遷移的是“動作與狀態變化之間的因果關係”。同一個模型,在仿真裡學到的物理因果,可以被帶到真實機械臂;在一次嘗試裡積累的失敗經驗,可以指導另一個相似物理過程的嘗試;人類的一次演示,也可以直接變成機器人的因果上下文。這種跨域遷移通過上下文完成。
模型在上下文中推斷環境因果結構,並把因果知識用於下一次動作生成。這就是Zeva所定義的In-Context Causal Learning。示例一:從放置稱量紙的誤操作中提取因果關係,完成上下文內學習,提升任務精度。示例二:從稱取試劑至稱量紙的誤操作中提取因果關係,完成上下文內學習,提升任務精度。示例三:從一次人類演示中完成上下文內因果學習。Zeva:把“因果學習”裝進模型上下文 △Zeva總體框架。
模型通過Causal Interaction Extraction、Dual-timescale Causal Memory、In-Context Policy Injection,在不更新權重的情況下實現部署中自進化。圖片來源:論文 Zeva是一個模型。它的Causal Transition Encoder、Dual-timescale Causal Memory、In-Context Policy Injection,都屬於模型推理鏈路的一部分。在每個環境步,Zeva提取三類信號:視覺狀態、動作編碼、觀察到的狀態變化。
它們被遞歸編碼為Causal Interaction State,並進一步投影為Phase Token和Causal Interaction Signal。這些因果信號被組織成雙時標上下文:Brief Interaction Trace負責當前嘗試內的連貫執行,Persistent Interaction Memory跨嘗試累積可複用經驗。決策時,Zeva檢索與當前任務階段匹配的交互證據,構造Causal Prompt,注入凍結的Cosmos3動作生成模型。整個過程零梯度更新。
技術拆解:Zeva如何“以小博大” 亮點一:Causal Transition Encoder,讓模型看見“動作→結果”。模型顯式學習動作引起的狀態變化。訓練目標包括因果效果預測、任務聚類和階段進度,讓Causal Interaction Signal真正攜帶物理因果信息。亮點二:雙時標因果記憶,讓模型可以跨嘗試自我進化。BIT保證當前執行的連貫性,PIM把一次失敗、一次修正、一次成功沉澱為後續可檢索的上下文。同一個模型在repeated attempts中越用越強。亮點三:In-Context Policy Injection,讓凍結模型直接消費因果上下文。
通過Causal Prompt把任務、階段和交互證據注入生成模型,不加額外噪聲、不參與flow loss,只作為條件影響後續動作。這是“不調權重也能進化”的關鍵設計。和傳統Test-Time Training相比,Zeva的差異很直接: 數據說話:自進化+One-Shot人類演示增強 在RoboCasa365-Atomic5上,Zeva平均成功率76.8%,效果最優。更重要的是部署後的self-evolution曲線:累計成功率從Evolve 1的26%提升到Evolve 4的73%。
真實化學實驗室ChemLab-Evo上,三個原子任務同樣呈現單調增長:Pick Up Test Tube從65%到100%,Place Beaker從25%到70%,Pour Water從30%到80%。Zeva還支持one-shot human demonstration enhancement:一次人類演示初始化PIM後,模型無需微調即可復現關鍵操作。量化結果顯示,人類warm-up在Place Beaker上最高帶來20個百分點的提升,在Pour Water上帶來15個百分點的提升。
△RoboCasa365上,Zeva在模型權重完全凍結的情況下,累計成功率從Evolve 1的26%提升到Evolve 4的73%。圖片來源:論文 △真實化學實驗室中,三個原子任務累計成功率隨嘗試里程碑提升。模型參數未更新。圖片來源:論文 △One-shot人類演示warm-up對三個原子任務的影響。虛線為有人類演示初始化,實線為純自進化。圖片來源:論文 為什麼Zeva是一個新範式?Zeva的深層意義,是把具身模型的scaling從“參數空間”延伸到“上下文空間”。傳統scaling通過擴大數據、參數、算力來提升模型能力。
Zeva展示的另一種scaling是:在部署過程中不斷增加可供模型消費的因果上下文。每一次嘗試都會產生新的interaction evidence,這些證據被壓縮為Causal Interaction Signal並進入雙時標記憶。模型每多一次交互,就多一次對當前物理環境的“隱式系統辨識”。這裡的理論基礎是:模型可以把每個新場景的環境屬性作為隱變量,在推理時從過去的動作-效果證據中推斷出來。物體質量、關節約束、接觸特性、摩擦條件,都可以通過交互信號被隱式估計。凍結策略因此可以在不改變參數的情況下,不斷逼近當前物理系統的真實動態。
更進一步,Zeva的Causal Interaction Signal是一個效應空間中的緊湊表示,直接編碼物理效應信息。跨任務effect retrieval實驗顯示,不同物體、視角和任務指令下的等價物理效應,會在該空間中彼此靠近。這意味著模型學到的是“這類物理效應如何產生”,同時也覆蓋具體任務的做法。這種表示天然支持跨域遷移,也讓“域變換”成為一個可計算、可檢索、可複用的技術概念。如果把VLA看作“任務理解與動作生成”的基礎設施,世界模型看作“經驗想象”的基礎設施,那麼Zeva定義的ICCL就是“現場因果學習”的基礎設施。
它把部署從“能力消耗”變成“能力積累”,把每一次失敗從噪聲變成可檢索的因果證據。如果ICCL成立,具身智能的scaling將多出一條獨立於參數規模的曲線:交互次數越多,因果上下文越豐富,模型對當前物理域的辨識越準,任務成功率越高。這才是“域變換”作為新範式的真正含義。結語 清華AIR與域變換聯手發佈的Zeva,重新定義了具身模型的自進化: 不調權重,也能越用越強;不重新訓練,也能從一次人類演示中學會新操作。域變換開啟的,可能是一條新的scaling路徑:讓機器人在真實物理世界中,自己學會因果,自己完成進化。
參考鏈接: [1]論文:Zeva: In-Context Causal Interaction Memory for Embodied Action Generalization [2]項目主頁:https://air-embodied-brain.github.io/Zeva/ 關於清華AIR與域變換 清華AIR(Institute for AI Industry Research, Tsinghua University)是清華大學面向第四次工業革命的國際化、智能化、產業化的研究機構,被視為中國AI產學研結合的第一梯隊。
域變換是清華AIR面向物理智能自進化時代孵化的公司,由劉雲新教授和曹婷教授發起,本次發佈的Zeva是清華AIR在具身智能方向從前沿研究走向產業落地的重要標誌。劉雲新 清華大學智能產業研究院副院長、博導、萬國數據冠名教授、首席研究員,國家級高層次人才、IEEE Fellow 前微軟亞洲研究院首席研究主管,長期從事AIoT、端側智能研究 獲得了MobiCom、MobiSys、SenSys等多個國際頂級學術會議獎勵,以及CCF科技進步一等獎等獎項。
曹婷 清華大學教授,北京市高層次引進人才 前微軟亞洲研究院首席研究主管,研究方向為邊緣智能、具身智能等 獲頂級會議最佳論文獎四次,工作入選ACM/Microsoft研究亮點等,其中ACM研究亮點由圖靈獎獲得者David Patterson親自撰文推薦。*本文系獲授權刊載,觀點僅為原作者所有。版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

3秒出片比播放還快,MiniMax打開了AI視頻的實時商業化路徑
MiniMax推出新一代影片生成模型H3 Max,生成5秒768p影片僅需不到3秒,速度已超越播放速度,並帶動AI即時直播與AI版短影片App等創新應用。該模型基於開源的H3進行後訓練與推理優化,吞吐量約為原版35倍,同時在圖生影片評比中拿下第一。市場上已出現多個由開發者打造的即時生成直播頻道,顯示此技術開啟新的商業化路徑,而MiniMax股價也在近期大漲。

奧特曼播客曝猛料:Astra操作電腦已達人類水平
OpenAI 執行長奧特曼(Sam Altman)近日在一場播客訪談中投下震撼彈,直言旗下 AI 代理系統 Astra 在操作電腦方面的能力,已經達到與人類相當的水準。這番談話迅速在科技圈發酵,外界普遍將其視為 AI 從「回答問題」邁向「實際動手執行任務」的關鍵分水嶺。 奧特曼在節目中並未停留在技術層面的描述,而是進一步闡述 AI 能力躍升後對社會結構的深遠影響。他特別點名高等教育體系,認為傳統四年制大學的養成模式已經跟不上時代,主張兩年就足以完成必要的學術訓練。

奧特曼直言:四年太久,大學兩年就夠
OpenAI 執行長山姆·奧特曼(Sam Altman)近日再度拋出震撼教育界的觀點。他向外界直言,傳統大學四年學制早已不合時宜,在人工智慧迅速改變知識取得與技能養成的當下,兩年時間便足以讓年輕人具備進入社會所需的核心能力。這番言論迅速在矽谷與科技圈引發熱烈討論,也讓外界重新審視高等教育的效率與未來走向。 奧特曼長期以來便對现行教育體系抱持批判態度。他認為,現行的大學課程設計源自工業時代的標準化思維,過度依賴課堂授課與學分累積,卻忽略了學生真正需要的是解決問題的能力與實作經驗。

月之暗面與微軟、谷歌、亞馬遜談判, 爭取最高30%服務分成
中國月之暗面就Kimi K3與美雲企談30%收入分成,具標誌性意義。 近日,財聯社報道,據消息人士透露,月之暗面正就Kimi K3 AI模型與微軟、亞馬遜、谷歌進行收入分成談判。月之暗面在初期談判中,正尋求從K3相關服務產生的收入中抽取最高30%的分成。 如果談成,這將是中國AI公司和美國雲巨頭之間,第一個大型模型收入分成協議。 不過談判仍處於早期階段,分成核算口徑、合作落地週期、服務邊界等核心細節尚未最終敲定。目前,涉及的三家雲廠商和月之暗面都拒絕對談判公開發表評論。

混元Hy4 preview輕量版來了!權重壓縮86%,性能幾乎不減
(公眾號:zhidxcom) 作者 | 程茜 編輯 | 心緣 9月1日報道,今日中午,騰訊發佈了其最新一代旗艦模型預覽版本Hy4 preview的輕量版模型,將模型權重從1.5TB壓縮到214GB。 騰訊混元的測試結果顯示,壓縮後的模型與Hy4 preview原始模型相比,長文理解、多輪長上下文檢索和原版基本在同一水平,數學有小幅回落。壓縮後模型能覆蓋日常編程輔助、工具調用、長文檔處理和常規問答。

2026年的一切,都只是Robocity的序幕
35分鐘前“最強大腦”與“最強小腦”相互需要2026-08-11百度AI的驗牌時刻到了2026-07-27閱讀更多內容,狠戳這裡查看AI測評DeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇馬斯克狂贊,硅谷大佬驚呼:Grok Bot是下一個ChatGPT時刻硅谷投資人稱Grok Bot是新ChatGPT時刻,為AI生產革命。