刷視頻也能教會機器人幹活!1200億tokens人類動作預訓練,誤差按冪律下降

個陌生家庭。它要收拾散落在客廳裡的玩具、疊毛巾、鋪床。機器人到達現場後,不再採集新數據,不更新模型權重,也不根據現場執行結果重新選擇模型。視頻很容易被概括成“人形機器人‘零樣本’做家務”。嚴格來說卻並非如此。三個任務此前都在其他環境中用專門數據做過適配。Figure所說的“零樣本(zero-shot)”,是指機器人第一次進入這些家庭,面對新的佈局和操作對象時,不再針對當地環境和物體重新訓練。注:Figure Helix 2.5在30個此前未採集任務訓練數據的灣區家庭中執行整理客廳、疊毛巾和鋪床任務。
這裡的“零樣本”指機器人面對新的家庭環境、空間佈局和操作對象實例時無需現場重新訓練,並不意味著模型此前未學習過這些任務;相關任務此前已使用其他環境採集的數據完成適配。來源:Figure 視頻之外,Figure還公佈了兩組更容易被忽略的實驗。第一組直接比較是否經過Index預訓練。Figure用同一批任務專屬數據訓練了兩套策略模型,架構、優化方式、超參數、下游數據和評估方法保持一致。一套隨機初始化,另一套從Index預訓練模型開始。前者在30個陌生家庭中的完整任務成功率為9%,後者達到56%。這個56%要求完整完成任務,部分完成任務的情況不得分。
以收拾客廳為例,所有玩具都必須進入籃子;如果出於安全原因需要人工干預,整個執行回合直接記為失敗。按照Figure披露的實驗協議,兩組模型之間的主要差異是——是否經過Index預訓練。另一組實驗轉向離線評測,專門考察預訓練數據規模。Figure用Index的四檔嵌套數據(nested data)子集訓練模型,預訓練數據總跨度為8倍;模型大小不變,下游訓練方式也保持一致。每個模型再使用相同的任務數據進行微調,比較留出測試集上的機器人動作預測損失。隨著Index數據規模翻倍,損失規律下降。
Figure還用較小規模實驗擬合趨勢,再預測最大規模模型的測試結果;官方稱,預測誤差只相當於整個8倍數據範圍內損失變化的0.54%。這兩組實驗結果很容易被囫圇理解為“Figure發現了機器人規模定律(Scaling Law)”,但它們本質上是對不同問題的回答。第一組實驗中的9%到56%說明,有沒有大規模的人類行為預訓練,會顯著影響機器人在陌生環境中的閉環泛化。第二組中的四檔數據的損失曲線說明,當人類數據預訓練規模繼續擴大後,這種收益在下游機器人動作預測上呈現出可測量的隨規模變化的曲線。Figure目前沒有公佈1倍、2倍、4倍、8倍Index預訓練分別對應多少真實家庭成功率。
也就是說,預訓練規模持續擴大,對閉環機器人表現會產生怎樣的連續變化,這條曲線還沒有公開。上:Figure在真實機器人閉環評測中,對比了未經Index預訓練與經過Index預訓練的模型。在其公開的多項未見任務中,Index預訓練模型的成功率均明顯更高;Figure在正文中將總體結果概括為完整任務成功率從9%提升至56%。這組實驗回答的是:“有沒有大規模人類行為預訓練,會不會影響真實機器人執行結果?” 下:Figure進一步使用4檔嚴格嵌套的Index數據,將預訓練規模從1倍擴大到8倍,並在模型規模、下游訓練和評估流程保持一致的情況下,觀察到適配後的機器人動作預測驗證損失持續下降。
這組實驗回答的是:“當人類數據預訓練規模繼續擴大,離線遷移指標是否呈現可預測的規模效應?” 兩組實驗並非同一條曲線。Figure目前尚未公開1倍、2倍、4倍、8倍Index預訓練規模分別對應的真實機器人閉環成功率,因此不能據此推導“預訓練規模擴大後,真實任務成功率按相同規律連續提升”。恰恰是這裡,讓2026年的機器人預訓練出現了一個比“Human Data有沒有用”更具體的問題: 人類經驗能不能像文本之於大模型那樣,成為機器人預訓練中一種可以持續擴展、並能預測下游收益的數據來源?Dyna:人類數據的規模效應已經進入真機閉環 Figure並不是第一個觀察到“人類數據越多,機器人越受益”的團隊。
8月,Dyna Robotics發佈Dyna-2。它把第一視角人類視頻構成1000小時、1萬小時、10萬小時和100萬小時四個嚴格嵌套的數據規模。更大的數據集只是在較小集合上繼續增加數據,而且各來源比例保持一致,儘量排除數據分佈變化對結果的干擾。隨後,Dyna把四檔模型用同一套機器人後訓練方法適配到14個真實機器人任務。四檔模型的平均歸一化得分,依次達到任務可達上限的20%、28%、45%和53%。也就是說,人類視頻預訓練時的規模差異,經過同樣的機器人後訓練以後,最終延伸到了真機閉環表現。
注:Dyna分別使用1000小時、1萬小時、10萬小時和100萬小時第一視角人類視頻進行預訓練,再將四檔模型用相同的機器人後訓練方案適配到14個真實機器人任務。隨著人類視頻預訓練規模擴大,14項任務的平均歸一化表現依次達到任務可達上限的20%、28%、45%和53%,說明預訓練階段的規模差異在經過相同機器人後訓練後,仍然延伸到了真實機器人閉環表現。這裡的20%—53%是Dyna為了彙總不同任務原生指標而定義的平均歸一化表現,並非任務成功率,也不能與Figure在30個陌生家庭中報告的56%完整任務成功率直接比較。因此,更準確的技術時間線不是“Figure第一次發現人類到機器人的規模定律”。
Dyna此前已經展示了更完整的跨本體、從預訓練規模一路延伸到閉環真機表現的證據;Figure則把可預測的遷移規模效應明確延伸到了全身人形機器人系統上,並用30個陌生家庭讓人類預訓練的現實價值變得更加直觀。百萬小時之外,Dyna還通過一組消融實驗追問:這種規模效應究竟從哪裡來?單獨預測動作時,模型隨著數據增加出現嚴重而不穩定的過擬合。加入未來視頻預測以後,39個機器人任務上的遷移表現整體改善;而當研究者進一步增加不帶動作標籤、只用於視頻預測的人類視頻時,跨本體表現才隨著數據規模呈現出穩定的單調提升。因此,單純說“擴大人類數據規模就會持續獲益”,仍然不夠準確。
數據是什麼,以及模型被要求從中學什麼,共同決定了規模效應會不會出現。一旦人類經驗開始成為機器人預訓練資產,追問自然就落到了數據來源本身:這些經驗應該從哪裡來?Figure:建立一套可控的人類數據供應鏈 Figure在Index發佈稿中把自己的判斷寫得很直白: “要規模化訓練真正通用的機器人,所需要的數據並不存在於來源廣泛的互聯網視頻。” 於是它搭建了一套自己的Human Data供應鏈。Index通過Creator創作者網絡,讓人們在真實家庭和工作場所記錄任務。到8月底,Figure稱平臺已經收到超過1600萬條視頻,並累計向創作者支付1500萬美元;Helix 2.
5發佈時,新的人類視頻數據正以約35分鐘/秒的速度進入Index。數據隨後還要經過質量過濾、反作弊、去重、重新平衡和文本標註。△Figure Index的數據處理流程,來源:Figure Index 注:Figure將Creator貢獻者上傳的真實世界視頻依次經過質量過濾與標註、反作弊審查、去重和數據再平衡,最終形成用於訓練Helix的數據集。與直接使用互聯網公開視頻不同,Index代表的是一條“主動建設人類行為數據基礎設施”的路線:通過持續採集、篩選和整理,更系統地獲得適合Physical AI訓練的大規模Human Experience。算力也在同步擴張。
9月初,Figure宣佈與英國AI雲廠商Nscale達成戰略合作。該合作涉及一份初始價值35億美元的算力承諾,未來合作規模或將擴大至60億美元以上;雙方計劃基於英偉達Vera Rubin平臺部署最高10萬顆GPU。Figure創始人兼CEO Brett Adcock直言不諱,Helix下一階段越來越受制於數據和算力。這是一條資本密集,但對數據分佈擁有更強控制力的路線。某類任務不夠,可以定向補;某種環境過多,可以重新平衡;長尾裡缺什麼,就繼續組織人在現實世界裡生產。Index不只是一個不斷擴大的數據集,更像是一套可以主動改變訓練數據分佈的基礎設施。但Figure目前尚未在Helix 2.
5相關材料中披露Index全量數據統一的拍攝視角構成,也沒有公開完整的人類動作監督機制。現在能夠確認的是,它正在以極大的規模採集、篩選和組織真實人類行為數據,而Index預訓練已經顯著改善了Figure自己的完整人形機器人系統。Figure的解法,是通過專門採集和數據治理,主動塑造自己需要的訓練分佈。行業同時在嘗試另一種辦法:不重新生產全部數據,而是提高模型從互聯網公開視頻中提取可遷移信號的能力。另一條路線:讓模型理解互聯網中的人類經驗 互聯網公開視頻不是天然的機器人數據(Robot Data)。
視頻中的鏡頭位置多樣,人體會被遮擋,動作也沒有關節控制標籤,更沒有機器人的本體感知、力反饋和接觸狀態。視頻裡一個人伸出手打開櫥櫃的幾十幀,距離一臺人形機器人真正需要輸出的控制信號還很遠。另外一些團隊沒有像Figure那樣採集更多專門為機器人而生的數據,而是嘗試通過模型學習和表示轉換,從已有視頻中提取可遷移信息。CoMo從互聯網視頻中學習連續的潛在運動表示,併為此前沒見過的視頻生成偽動作(pseudo-action),再與有限的機器人數據共同訓練策略模型。“互聯網視頻能否轉成與動作相關的監督信號”,並不是一個全新的命題。HuRo做得更直接。
它把來源和視角各異的人類視頻 “機器人化”,轉化成更接近機器人觀察和動作分佈的數據;隨著這類預訓練數據擴大,真實操作任務的完成度和分佈外(OOD)表現繼續改善。Rhoda則繞開了顯式的人類動作。它用來源廣泛的互聯網視頻訓練因果視頻模型,讓模型先預測世界接下來如何變化,再通過逆動力學模型把這種預測轉換成機器人動作。近期的真實工業任務實驗顯示,更大的預訓練模型和更多訓練算力都能改善機器人策略,而且當機器人數據較少時,更強預訓練帶來的收益更明顯。
這些方法雖然機制不同,卻都在檢驗另一種可能:當原始數據離機器人分佈較遠時,能否通過表示學習(representation learning)、動作恢復或世界建模來彌補其中的差距。互聯網視頻的確沒有現成的機器人動作軌跡。但其中的人類行為、物體交互和物理世界規律,究竟有多少能夠被重新編碼成物理AI真正能用的經驗,仍然沒有定論。亮源新創(Light Origins)則大膽地把問題又往前推了一步:數據源直接來自普遍存在的互聯網人類行為視頻。
亮源新創:把預訓練數據源推向互聯網規模 亮源新創選擇的不是專門為機器人訓練採集的數據,也不是主要依賴第一人稱人類視頻,而是嘗試從互聯網中的第三視角人類行為視頻中提取可遷移經驗。互聯網上已經積累了海量人類行為視頻。這類數據更容易實現規模化和多樣性,代價則是更大的人機域差異(domain gap):鏡頭並不跟隨視頻中的人類身體,動作可能被遮擋或剪輯,人類和機器人身體結構不同,視頻裡沒有可以直接執行的動作標籤。
根據9月21日亮源新創官網正式發佈的技術博客來看,Light-O1先從視頻中恢復結構化人類動作,再編碼成統一的人形動作表示,與視覺、語言信息一起進行自迴歸預訓練,最終得到一個人類動作先驗(Human Action Prior)。△來源:據亮源新創技術報告整理製作 注:從機器人遙操作、UMI等機器人數據,到第一視角人類視頻,再到互聯網規模的第三視角人類行為視頻,數據來源覆蓋範圍逐步擴大,同時也伴隨著視角、本體和動作表示差異的增加。本圖用於說明亮源新創選擇的人類動作預訓練數據來源位置,不代表不同數據來源之間的性能比較。此次技術博客披露的人類動作預訓練規模,從37.
5億擴展到1200億詞元(token),最大規模約對應10萬小時人類動作。Light-O1分別在第一視角人類數據、公開機器人數據和亮源新創自研人形機器人數據上進行目標域適配。隨著人類動作預訓練規模擴大,適配後的動作預測誤差、全身姿態誤差和腕部位置誤差均持續下降,並呈冪律趨勢。亮源新創將這一現象稱為“遷移縮放定律”(Transfer Scaling Law)。△Light-O1展示人類動作預訓練規模與跨本體預測誤差之間的縮放關係。來源:亮源新創技術報告 注:亮源新創將人類動作預訓練規模從37.
5億tokens擴展至1200億tokens,並在第一視角人類數據、Unitree G1機器人以及亮源自研人形機器人數據等目標域上進行評估。實驗顯示,隨著預訓練規模擴大,動作預測誤差和身體姿態預測誤差在不同目標域上持續下降,呈現冪律縮放趨勢。該結果基於目標域適配後的預測指標,用於衡量預訓練規模與遷移效果之間的關係,並不等同於真實機器人閉環任務成功率。人類動作先驗並不是亮源新創首創;從公開的互聯網視頻中提取與動作相關的信號,也已經有CoMo、HuRo等近鄰工作。
Light-O1這次更值得關注的,並不是“用了互聯網視頻”本身,而是把幾件此前通常分開研究的問題放進了同一組規模實驗:互聯網規模的人類動作視頻、結構化動作恢復、持續擴大的預訓練規模,以及這些規模收益在不同機器人和人形機器人目標域適配後仍然保留下來。至此,亮源新創首次驗證了互聯網規模的人類動作預訓練對多本體人形機器人的遷移縮放定律。注:視頻展示Light-O1當前模型在機器人平臺上的任務執行能力,用於說明預訓練和後續適配後的模型具備真實可執行行為。本文討論的“遷移縮放定律”仍以留出數據上的開環評測為依據。
來源:亮源新創 更值得追蹤的是:如果模型真的能從距離機器人更遠的數據裡持續獲得可遷移的動作先驗,這條“Scaling”(規模效應)之路最終能走到閉環真機的哪一步?從離線遷移到閉環表現,不同“規模效應”不是一回事 當把Figure、Dyna和亮源新創放在一起,很容易把不同層級的“Scaling”混為一談。注:不同團隊正在探索Human Experience如何轉化為機器人能力。目前公開研究已經分別展示了從人類經驗規模化、跨本體遷移、真實機器人閉環表現等不同層面的證據。由於不同研究採用的數據、模型和評測協議不同,本圖用於展示公開證據所在層級,不代表企業能力排名或橫向比較。
製圖:原文作者 最基礎的一層,是預訓練本身能不能隨著數據增加持續改善。再往下一層,是這種改善離開人類數據域以後,能不能在機器人或人形機器人目標域中繼續存在。Figure的四檔Index實驗和亮源當前的核心結果,主要落在這裡:更大規模的人類預訓練,對應更好的下游機器人動作相關離線指標。然後才進入真實機器人的閉環表現。Figure用Index預訓練和隨機初始化的9%對56%,證明“有沒有預訓練”會顯著改變機器人在陌生家庭裡的實際執行結果;但它尚未公開Index規模每翻倍、閉環成功率如何連續變化。
Dyna則已經用四檔人類視頻預訓練,在相同機器人後訓練條件下得到20%、28%、45%、53%的平均歸一化閉環得分。兩套數字定義完全不同,不能橫向比較。再往下一步,才是最接近產業經濟的問題: 達到相同能力時,更強的預訓練究竟能少用多少新的機器人真實經驗?Figure給出了一個值得關注的信號:Helix 2.5在一個同任務比較中,只使用此前Helix 02約一半的任務專屬數據,就達到相近成功水平,同時把部署範圍擴展到了30個陌生家庭。但這組比較跨了模型代際和評估條件,並不是嚴格控制的等性能實驗,因此不能直接推導“Index普遍把機器人數據需求減半”。
Dyna用大約10分鐘機器人示範就完成Bottle Cap Untwisting的實驗同樣有吸引力,而且表現隨著人類視頻預訓練規模繼續提升;但它依然不是一條可以直接換算“多少小時人類數據等於多少小時機器人數據”的曲線。就目前公開證據而言,亮源新創驗證到的仍主要是適配後的離線遷移。因此,它下一步最有信息量的實驗其實很明確:固定機器人適配方案,讓不同人類動作預訓練規模的模型逐一進入閉環;再改變機器人數據預算,看能否形成等性能曲線。到那一步,才有條件真正討論“互聯網級人類動作”的數據經濟性。計算最終著眼處:整條數據成本鏈 機器人行業習慣用“小時數”描述數據規模。
一小時遙操作數據多少錢,一小時Human Video多少錢,現有的互聯網視頻則幾乎不需要重新去採。按照這種算法,Figure看起來昂貴,互聯網原生路線似乎天然便宜。實際賬本遠沒有這麼簡單。Figure願意為Creator創作者、採集體系、質量控制和主動數據再平衡付錢,換來的是更可控的數據分佈:缺什麼,就能繼續生產什麼。35億美元級別的算力合作,則繼續把這套數據基礎設施推向更大的模型。從互聯網公開視頻出發,確實省掉了重新讓人執行一次任務的物理採集成本。
新的賬單會出現在別處:哪些視頻值得留下,人體動作能恢復到什麼精度,鏡頭運動和遮擋如何處理,怎樣把人類動作轉成機器人可用的表示,以及需要多少訓練算力,才能把這些嘈雜經驗真正壓進模型。Dyna提供了第三種可能:並非所有視頻都必須恢復出高質量動作標籤,世界建模本身也可以讓大量只有視覺經驗的視頻參與規模化學習。所以,這場數據戰未必會以“誰擁有更多視頻”決勝,更不能只比較兩種路線的原始採集成本。真正要算的是整條鏈路。從得到一段經驗,到它最終變成機器人可以遷移、可以執行的能力,需要支付的不只有采集成本,還有表示、對齊、算力,以及最後仍然難以完全省掉的真實機器人經驗。Helix 2.
5讓人類經驗成為一條更難忽視的規模化軸線;Dyna已經證明,這條軸有機會一路穿到真實機器人閉環;亮源新創則把實驗繼續推向距離機器人數據分佈更遠但卻最為豐富的互聯網級人類行為。接下來值得比較的,也許不再只是哪個公司擁有最多“小時數”。而是機器人獲得下一項能力時,整條鏈路還要向真實世界支付多少成本。*本文系獲授權刊載,觀點僅為原作者所有。版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

AI會自己返工到達標為止?豆包工作上線目標模式,先給計劃、確認後才幹活
目標模式面向有明確要求的複雜任務:用戶寫清楚驗收目標後開啟執行,豆包工作在完成任務後會對目標逐項校驗,只要有一項不達標,就自動返工、繼續調整,直到達標。計劃模式則面向步驟多、消耗大的複雜任務:豆包工作會先產出一份可審閱、可編輯的Markdown格式實施計劃,供用戶校準修改,待對齊工作需求並確認後才開啟執行,使執行過程更可控、資源與時間消耗更合理。

啟仔遠仔,想成為第一個被你帶回家的硅基夥伴
啟元 T1,兩款機器人當天開售,基礎版本售價 19999 元。這是整個行業第一次有人把量產消費級人形機器人推進市場,且發售即發貨,10 月 1 日啟元就將按訂單陸續發貨。01Q1與T1,同一個問題的兩種回答啟元這次發佈的兩款機器人,一個叫 Q1(暱稱“啟仔”、“Q仔”),一個叫 T1(暱稱“遠仔”)。

深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 萬條軌跡才是底牌
本文作者: 鄭佳美 2026-09-23 12:07 導語:代碼、視覺、安全共用一套 RL,獎勵機制也被重新設計。代碼、視覺、安全共用一套 RL,獎勵機制也被重新設計。作者丨鄭佳美 編輯丨岑 峰 剛剛,小米正式發佈並開源 MiMo-V2.6。

當 AI 開始給自己動刀,“智能爆炸”可能真不遠了:兩篇論文拆解AI下一步進化路徑
硅谷Tech news2026.09.23 10:17 · 來自北京全文6004字00:00 / 14:22當 AI 開始“改進自己”,AI 的下一個躍遷,取決於在群體中相互成就。最近,AI 圈同時被兩件事刷了屏:一邊是 MIT 材料科學家 Markus J.
阿里雲發佈Qwen Book:AI智能體電腦正式亮相
產品搭載Skill鍵盤陣列、全局AI按鍵、語音手寫筆等交互入口,並提供支持7×24小時運行重度任務的操作空間,針對傳統AI辦公中跨應用、跨Agent協同效率不足的問題進行優化。Qwen Book基於“OS as Harness”理念,以千問端雲模型為核心,深度融合操作系統、應用、雲服務與硬件能力,統一管理交互入口、運行時環境、個人持續上下文以及軟硬件操控能力,構建可理解、可記憶、可持續運行和可治理的Agent計算環境。
AI會自己返工到達標為止?豆包工作上線目標模式,先給計劃、確認後才幹活
目標模式面向有明確要求的複雜任務:用戶寫清楚驗收目標後開啟執行,豆包工作在完成任務後會對目標逐項校驗,只要有一項不達標,就自動返工、繼續調整,直到達標。計劃模式則面向步驟多、消耗大的複雜任務:豆包工作會先產出一份可審閱、可編輯的Markdown格式實施計劃,供用戶校準修改,待對齊工作需求並確認後才開啟執行,使執行過程更可控、資源與時間消耗更合理。