教機器人幹活,光“刷課時”可不夠!靈初這次較真數據質量

2026年9月24日 13:56
教機器人幹活,光“刷課時”可不夠!靈初這次較真數據質量
站內 AI 整理稿

看這組對照視頻:一邊是人手操作,一邊是機械手操作。乍一看,像是人先做了一遍,機器人再照著學。但順序恰好反了——機械手那段才是真實記錄,人手那段則是AI根據它生成出來的。△Psi-W0將人手示範轉化為機械手可執行的操作軌跡 為了讓機器人學人,為什麼反而要從機器人的動作開始?這看起來有點繞,卻指向了一個很實際的問題:人類每天都在幹活,這些經驗,到底怎樣才能交給機器人?就在上週,Figure發佈Helix 2.5,使用人類行為數據集Index進行預訓練,在完成三類家務任務的適配後,將機器人帶進30個未採集過數據的家庭進行測試。這項研究關心的,正是從人類經驗中學到的能力,能否幫助機器人應對新的環境。

靈初智能這次進一步追問:人類數據進了模型,不等於人的操作經驗就能被機器人直接使用。這中間,還缺什麼?在十萬小時級數據積累的基礎上,靈初智能的模型Psi-R2.5繼續改進數據質量與人機數據對齊方法,並進一步推進具體任務適配。它關注的不只是讓機器人看過更多操作,還包括怎樣把這些操作變成有效的訓練材料,以及面對新任務時,怎樣更容易地教會它。而開頭那個看似繞遠的辦法,恰恰是為了少繞一些彎路。教機器人學人,這次先倒著來 人和機器人,都能拿起一瓶可樂。但兩段“拿可樂”的視頻放在一起,就能教機器人照著做嗎?

這裡面仍然存在一些“老生常談”的問題:人手和機械手不僅長得不一樣,關節結構、接觸物體時的摩擦條件也不同。再加上人手姿態估計的誤差,一個人可以順利完成的動作,轉換成機器人的關節運動後,未必還能成功。所以,給機器人看懂“這是在拿可樂”,和提供一份“可以這樣拿起可樂”的動作數據,是兩回事。靈初把人和機器人執行類似任務、主要在任務含義上對應的數據,稱為“弱配對數據”。它更希望獲得的,是另一種對應關係:除了人和機器人本體不同,兩邊的場景基本一致,動作時序逐幀對應,而且機器人一側的動作能夠在真機上直接回放成功,這就是“強配對數據”。

△弱Pair與強Pair的對比 強配對數據強調對齊,不只是要求人和機器人“都做了同一件事”,而是“人的這段操作,對應著機器人這段可執行的動作”。但這樣的數據,很難直接採集。讓人和機器人各做一遍,很難保證場景和動作時序逐幀對應。直接照搬人的軌跡也未必成功,因為兩者的關節結構、摩擦條件並不一樣。今年4月,靈初已經嘗試讓Psi-R2與世界模型Psi-W0配合,通過軌跡推演和強化學習,將人類操作轉換成可執行的機器人數據。問題是,這套流程涉及多個模型協同和策略優化,生產數據的過程比較重。靈初巧妙地換了一個方向:為什麼一定要從人類操作出發,再費力生成一段能夠成功的機器人動作?

反過來,真實機器人操作的圖像和動作,本來就是可用的。以它們為起點,生成匹配的人類數據,不就可以獲得一份新的對照樣本?按照這條思路,靈初逆向使用Psi-W0,從真實機器人數據出發,生成對應的人手操作數據,再將這些高質量配對數據用於訓練端到端轉換器。這個轉換器的輸入是人類操作數據,輸出則是匹配的機器人圖像和動作。△高質量機器手-人手配對視頻 △只需用手機在日常場景中錄製一段人手操作視頻,即可通過模型轉換為對應的機器人數據。這裡需要區分一下,轉換器不是負責決定機器人下一步做什麼的策略模型,而是一個帶動作輸出的視頻編輯模型。

它要做的,也不只是把畫面中的人手換成機械手,而是同時得到機器人可以使用的動作數據。那怎麼判斷轉換有沒有用?靈初設置了兩種驗證方式:一種是直接在機器人上回放轉換後的軌跡,看能否完成相同任務;另一種是把轉換後的數據用於後訓練,再看訓練出的模型能否完成相關任務。判斷標準不再只是“生成的視頻像不像”,而是數據能不能支持實際操作。據靈初介紹,轉換後的數據已在上述兩類測試中得到驗證。不過,部分特別複雜的任務仍未直接完成,數據轉換並不等於所有任務都已經解決。沿著這條思路,Psi-R2.5也重新梳理了數據本身的質量。

靈初減少同一任務的重複堆積,增加任務多樣性,並通過自動標註管線,把任務拆解到更細的原子動作,再進行標註和審核。畢竟,數據的價值,不能只按小時算,還得看覆蓋了多少種任務、機器人能用上多少。△Psi-R2.5多任務評測效果 視頻,也能當機器人的prompt 如果一段人類操作,已經能轉換成機器人更容易使用的參考,那麼它或許也可以有另一種用途:不只是進入訓練集,也可以成為當前任務的提示。這也意味著不必把所有要求都寫成一大段指令,而是給機器人一個例子——“照著這個來”。這是靈初在Psi-R2.5中進一步探索的上下文學習,也就是In-Context Learning,簡稱ICL。

在其展示的任務中,機器人不需要更新模型參數,而是根據當前上下文提供的線索,推斷該做什麼、該如何做。△Psi-R2.5 In-Context Learning展示 這裡有一個關鍵變化:新示範不一定要再走一遍訓練流程,才能影響機器人的行為。它也可以作為當前任務的參考,交給已經訓練好的模型使用。難點仍然在於,示範來自人,執行者卻是機器人。靈初的思路,是利用前面的強配對數據模型,將人類示範轉換成對應的機器人數據,再更好地作為提示輸入模型。同一種數據轉換能力,由此有了兩個用途:一是準備訓練材料,二是幫助機器人理解眼前的示範。這也與Psi-R2.5的雙層架構相銜接。

它的上層模型負責拆解長程任務,把一段較長的指令分成子任務;下層模型則結合子任務和當前觀測,輸出具體操作軌跡。一個負責拆清楚要做什麼,一個負責落實到動作。換個任務,不一定要重新訓練模型,也可以用一段示範告訴機器人該怎麼做。當然,這裡的不用重新訓練,不等於模型此前沒有訓練過,也不等於隨手拍一段視頻,就能讓機器人完成任何工作。目前靈初展示的是特定任務中的ICL能力,更多實現細節尚待公佈。但它提供了一個值得繼續觀察的方向:人的示範,不一定只能是離線訓練時使用的材料,也可能成為實際使用機器人時的一種交互方式。

99%成功率,不止靠預訓練 預訓練已經用了十萬小時級的數據,為什麼到了客戶現場,機器人還得接著練?在靈初看來,真實部署面對的物品種類、規格和作業節拍,往往帶有很強的定製化要求。短期內,不能指望基礎模型完全不做適配,就直接進入所有客戶現場;後訓練仍然是必要的一環。那訓練基礎模型的意義是什麼?靈初在最新的Tech blog中明確指出,預訓練並不是讓後訓練立刻消失。從部署角度來看,現階段訓練基礎模型的意義應該是讓後訓練需要的數據更少,從而降低適配與部署的成本。手機盒裝配,就是一個具體例子。這個任務涉及多個步驟,對操作精細度也有較高要求。

據靈初介紹,通過結合人工參與與強化學習的後訓練框架,經過幾輪迭代,任務成功率達到約99%,耗時1-2個工作日。預訓練積累的本事,在這裡派上了用場:機器人不用從零學起,只需補充少量任務數據,再通過人工參與和強化學習,把容易出錯的地方練好。到了客戶現場,訓練也沒有結束。機器人在哪裡失敗,相關數據就被收集回來,用於下一輪改進。團隊表示,這套方案已經用於實際客戶現場,處理作業中遇到的複雜情況。這與前面的示範引導並不矛盾。示範提供一種表達新任務的方式,後訓練則繼續處理具體操作中的難點。兩者不是要求機器人每次都從零開始,而是在已有能力上,減少適應新需求的額外投入。Psi-R2.

5正把預訓練積累的能力用到具體工作中。用好人類經驗,讓客戶少花時間、少花成本就能把機器人用起來,是靈初持續改進基礎模型的目標。Tech blog:https://cypypccpy.github.io/tech-blog.github.io/ https://cypypccpy.github.io/scaling-pair-data.github.io *本文系獲授權刊載,觀點僅為原作者所有。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

這屆網友,正逐漸對十級濾鏡“祛魅”

數字力場2026.09.24 09:46 · 來自浙江全文4738字00:00 / 11:15在大眾審美趣味被暴力美顏調教得“活人感不足,假面感有餘”的當下,很多人希望抵禦軟性的審美規訓——哪怕真實必然伴隨著缺陷。文 | 數字力場,作者 | 佘宗明作家海明威曾說過:Good writing is true writing(好的寫作就是寫出真實)。將“寫作”改成“拍攝”,其實也成立。

剛剛

智元第兩萬臺遠徵A3 Ultra下線交付長隆,六千臺半年填滿,具身機器人第一次在主題樂園裡常態上崗

9月24日,第20000臺通用具身智能機器人遠徵A3Ultra在橫琴長隆飛船樂園正式走下產線,並當場交到長隆集團手裡。從今年3月跨過萬臺門檻到如今的兩萬臺,這家公司只用了約6個月——產能爬坡的曲線,已經明顯進入了加速段。同一天,由智元與長隆聯手打造的全球首個大規模具身智能主題樂園在橫琴長隆飛船樂園啟幕,超過300臺智元全系機器人開始在園區裡常態化上崗,扎進遊客互動、導覽、演藝和科普研學等場景。

28 分鐘前

稚暉君把機器人賣到2萬元一臺,可人可狗可開發!

稚暉君(彭志輝)正式開賣個人機器人Q1與可變形機器人T1,售價均為19999元起,主打可創造與隨行,並開放二次開發平台。上緯新材轉型投入消費級機器人,上半年研發投入約1.64億元,但機器人業務尚未產生營收,公司出現虧損。

17 小時前

李飛飛談 AI 安全:不能只讓開發者評估自己的系統

她認為,對於能力日益強大的 AI 系統,其安全評估不應完全交由開發這些系統的公司負責。評估不能只交給開發公司作為斯坦福大學教授、World Labs 聯合創始人,李飛飛週二表示,儘管 AI 公司的內部研究人員可以評估單個模型的能力和安全性,但這無法替代由政府、行業和學術機構共同制定的更廣泛標準。

19 小時前

李飛飛談 AI 安全:不能只讓開發者評估自己的系統

她認為,對於能力日益強大的 AI 系統,其安全評估不應完全交由開發這些系統的公司負責。評估不能只交給開發公司作為斯坦福大學教授、World Labs 聯合創始人,李飛飛週二表示,儘管 AI 公司的內部研究人員可以評估單個模型的能力和安全性,但這無法替代由政府、行業和學術機構共同制定的更廣泛標準。

1 天前6800

聯合國 AI 專家反對 AI 末日論,呼籲理性討論

作者:遠洋 責編:遠洋 評論: 9 月 22 日消息,聯合國下屬人工智能委員會的多名專家於當地時間週一發出提醒,反對業內部分從業者針對 AI 風險所發表的世界末日式言論。獨立機構國際 AI 科學專家組(International Scientific Panel on AI)成員、谷歌 DeepMind 高管若埃爾 · 巴拉爾(Joelle Barral)表示:“身為科研工作者,我們應當投入精力開展科學研究,釐清哪些內容已有定論、哪些尚且屬於未知。

1 天前