量子位生成式AI

全球首個!銀河通用新框架僅需人類視頻即可部署,特斯拉蚌埠住了

2026年7月16日 18:57
全球首個!銀河通用新框架僅需人類視頻即可部署,特斯拉蚌埠住了

重點摘要

銀河通用發表全球首個具身智能測試時後訓練框架 WAM-TTT,讓機器人僅靠人類實拍影片即可在部署階段快速適應新場景。此方法無需昂貴的遙操作數據或重新預訓練,大幅降低成本,同時維持原有能力,為機器人規模化落地提供新解方。

站內 AI 整理稿

### 全球首個!銀河通用新框架僅需人類視頻即可部署,特斯拉蚌埠住了

具身智能領域迎來重大突破,機器人終於也能像大語言模型一樣,在部署後持續學習、自我進化。北京時間7月16日,銀河通用正式發布全球首個面向具身智能大模型的測試時後訓練框架——WAM‑TTT(World-Action Model Test-Time Training)。這項技術首次將「測試時訓練」(Test-Time Training)範式從自然語言處理與大語言模型領域,成功遷移至物理世界中的機器人控制,標誌著機器人正式告別「一次訓練、終身固定」的時代。過去兩年,大模型最重要的發展趨勢之一,就是能力不再完全依賴預訓練階段一次性決定,而是留到推理時刻再兌現。

OpenAI的o1、DeepSeek的R1皆是如此,模型透過在應用過程中持續自我提升,進一步強化推理能力。然而機器人面臨的是遠比文本複雜的物理世界,任何一次誤判都可能損壞抓取對象,業界始終未能讓機器人像大模型一樣在部署時進化。銀河通用此次發布的WAM‑TTT,成功填補了這項空白。這項框架的核心突破在於:機器人可以「現學現上崗」。但這裡的「學」並非學習具體動作,不是要機器人看一遍影片就學會一項新技能,而是讓機器人透過人類示範影片充分理解當前場景的資訊,再將這些資訊寫入臨時記憶,最後結合原有已掌握的動作能力完成任務。

如此一來,機器人既能適應全新環境,又不會丟失原先已具備的能力,實現部署後的連續學習。為了讓讀者更容易理解,可以用一個廚師的例子來類比。假設機器人是一位已經出師的廚師,從出廠那天起就擁有紮實的基本功。現在顧客走進後廚,希望廚師做一道沒做過的菜,並且提供了教學影片。一般的機器廚師會逐幀模仿學習,但WAM‑TTT的做法不同:它會先把顧客的要求寫在一張便籤上,然後調用自己已有的廚藝,再照著便籤把菜做出來。這張便籤,就是WAM‑TTT的核心機制——一塊獨立的小型參數儲存單元,稱為快速權重記憶(fast-weight memory)。

WAM‑TTT的底座是一個預先訓練好的世界動作模型(World Action Model,WAM),內部由影片專家與動作專家兩部分組成。前者負責理解當前畫面中發生的事件,後者負責生成對應的機器人動作,兩者之間透過聯合注意力機制保持溝通。值得注意的是,在WAM‑TTT的整個流程中,WAM的主體權重全程保持凍結,不會隨學習過程更新,所有學習操作都只在記憶模組中完成。整個訓練過程分為兩個階段。第一階段是元訓練(Meta-Training),也就是機器人的出廠設定。

團隊藉助成對採集的人類與機器人演示數據,透過Key-Value向量對自適應記憶,實現人類視覺線索與機器人行為的對齊——相當於教會廚師如何讀懂顧客的便籤。第二階段是測試時訓練(Test-Time Training),這才是用戶實際操作階段。用戶只需提供一段未標註的人類RGB影片,主WAM完全鎖死,僅更新輕量化的記憶模組參數。完成記憶更新後,WAM‑TTT就會將學習到的操作邏輯送入相機觀測畫面,模型再輸出機械動作完成任務。與傳統架構相比,WAM‑TTT實現了四點突破。首先,大幅降低機器人軌跡數據依賴。

部署階段可擺脫對昂貴人工遙操作數據的需求,例如特斯拉Optimus的訓練數據長期依賴現場數據採集,在加州弗里蒙特工廠上百人的數據採集團隊中,每人每天要在長達8小時的輪班中重複數百次相同動作,人力物力成本極高。WAM‑TTT僅用未標註的人類影片即可完成後訓練,成本大幅降低,完成度卻能逼近甚至持平專業遙操作數據。實驗顯示,當訓練數據由100條機器人軌跡加上100條人類影片組成時,任務平均成功率可達74.1%,與全部使用機器人軌跡訓練的效果基本相當,意味著在一定條件下,一段普通人的影片幾乎可以1:1替代一段昂貴的機器人遙操作數據。其次,無需人類動作標註。

許多Human-to-Robot的學習方法雖然也使用人類影片,但仍需要額外完成手部姿態估計等步驟,WAM‑TTT則完全跳過,直接採用自監督學習,讓模型自行理解任務過程。團隊專門設計對照實驗,加入人體姿態估計與動作重定向後,四個任務平均完成度僅28.9%,比原始WAM‑TTT掉了整整43.4個百分點,尤其在Table Bussing任務上從100%直接降至33.3%。第三,不改模型、不重新預訓練。團隊分別與兩種更直接的方案進行對比:第一組是WAM-COTRAIN,直接將人類演示數據混入聯合訓練,結果任務成功率只有29.

8%,反而低於完全不用人類數據的基線;另一組是WAM-LoRA,使用更通用的參數高效微調方法,卻在Table Bussing和Swap Place兩個任務上分別只拿到30%和0%,而WAM‑TTT則達到100%與88.9%。這證明凍結基礎模型、僅透過快速權重完成部署階段適應,不僅成本更低,也能更充分發揮人類影片的價值。第四,避免災難性遺忘。團隊將WAM‑TTT分別放在標準訓練場景與未知的真實家庭環境中進行跨環境評測,性能保持率約75.6%。作為對照,同樣利用人類影片但僅透過上下文學習(In-Context Learning)提供資訊的模型,平均完成率從48.4%驟降至7.

1%,性能保持率僅14.7%。在進一步的細粒度測試中,改變光照條件與物體空間位置後,WAM-ICL完成率只有12%至20%,而WAM‑TTT仍維持約60%的水準。這清楚說明了權重適配對保持原有能力穩定、實現跨場景泛化的關鍵作用。這四點突破分別對應具身智能後訓練的四個核心難題——數據成本、標註成本、訓練成本與持續學習能力,WAM‑TTT逐一擊破。然而,要在具身智能領域實現測試時訓練,難度遠比在大語言模型領域高得多。文本世界中token是離散的,生成錯了可以重新採樣一次;但機器人的動作空間是高維連續的,一個抓取動作的力度與角度差之毫釐,結果可能天差地別。

文本世界對即時性要求不高,機器人卻必須跟上物理世界的時間尺度,決策慢一拍就可能錯過抓取窗口。更關鍵的是,機器人的物理交互一旦發生就不可逆。這也是為什麼WAM‑TTT值得被高度關注。銀河通用自成立以來,一直堅持具身多模態大模型這條路徑。2025年,團隊與北京大學合作在ICCV首次發表WAM,融合了世界模型與VLA兩條主流技術路線,被業界公認為具身智能的下一代技術方向。2026年,團隊進一步發布AstraBrain WAM系列進階成果,並在後續的LDA-1B模型中,首次將網際網路數據、人類影片、機器人遙操作數據等異構數據統一有效利用,讓WAM具備了清晰的規模化訓練路徑。

如今WAM‑TTT補上了最後一塊拼圖,成為銀河星腦(AstraBrain)持續學習體系中最新規模化部署技術的關鍵模組,也是一項世界級原創性技術創造。預訓練賦予機器人通用能力,後訓練讓機器人在掌握具體技能之後快速適應新場景,兩者銜接,讓從預訓練到部署後持續學習的技術閉環第一次完整跑通。從行業視角看,WAM‑TTT不僅是一次演算法的突破,更將具身智能帶到了規模化商業部署的門前。在《2026年度人形機器人與具身智能實景實訓專項行動》中明確指出,到2026年底,人形機器人產業將率先在一批代表性場景中完成規模化應用驗證與常態化落地;但前提是部署成本必須降下來。

WAM‑TTT將後訓練環節的成本從遙操作級壓縮至手機拍攝級,直接踩在行業剛需上。當機器人真正學會在真實世界中不斷積累經驗時,銀河通用乃至整個行業,距離2028年機器人「ChatGPT時刻」又近了一步。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

16 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前