不只強在硬件!宇樹6B具身大腦拿下7項開源SOTA,對標GPT-6 Astra
作者 | 江宇 編輯 | 漠影 全球具身智能的競爭,正從本體的比拼延伸到“大腦之戰”。谷歌Gemini Robotics 2喊出“一個大腦,適用於任何機器人”,英偉達Jim Fan更是拋出“VLA已死,世界動作模型當立”。誰能成為具身智能的新一代通用模型底座?國內,宇樹科技正在把這件事往前推一步。近日,宇樹新一代通用人形機器人基礎模型UnifoLM-WLA-1.0亮相,6B參數、約2500小時真機訓練,具身推理直接拿下7項開源SOTA,多項空間理解任務還反超GPT-6 Astra。同時,宇樹宣佈將開放模型、代碼和數據集。對於機器人而言,模型能力還是要落到真實任務中。
人形機器人什麼時候能進入更多真實場景,實現“通用勞動力”?宇樹正在試圖回答這一靈魂一問。UnifoLM-WLA-1.0單模型即可統籌64項任務,從疊毛巾、收納餐具,到鋪床、倒垃圾、把衣服放進洗衣機,驗證了其強大的模型泛化能力。而這背後藏著行業多年未解的老問題。過去的Demo多是單一任務、單一場景、高度定製,演示起來漂亮,換個環境就難複用,始終難以規模化。而一套模型能否覆蓋更多任務、更多場景,恰恰是機器人走向通用的重要一步。宇樹此舉,正試圖讓國產廠商成為“具身智能大腦”的定義者。一、拿下7項開源SOTA,比肩GPT-6 Astra:國產廠商搶“具身大腦”定義權 先看具身推理能力。
UnifoLM-WLA-1.0的具身推理底座是UnifoLM-ER-1-4B。該模型基於Qwen3-VL-4B訓練,使用超過500萬條具身推理樣本,在16項多模態感知與理解基準中有7項領先表中參評的開源模型。其中部分空間理解能力已經逼近甚至超過頭部閉源模型。在Where2Place、BLINK、CV-Bench和EmbSpatial等基準中,UnifoLM-ER-1-4B的部分成績高於GPT-6 Astra。以Where2Place為例,UnifoLM-ER-1-4B得分82.0,GPT-6 Astra得分69.0;在EmbSpatial上,兩者分別得分88.9和83.3。
對機器人來說,空間理解比單純聊天能力關鍵得多。看得懂東西在哪、怎麼擺、下一步會發生什麼,才談得上做得對,也才具備走進真實世界的資格。再看執行能力。UnifoLM-WLA-1.0把感知、推理、未來變化預測和動作生成連接起來,一個模型覆蓋64項任務,包括54項桌面操作和10項全身操作,並支持二指夾爪和多種五指靈巧手。桌面側,它能疊衣服、收納餐具、給電池充電、整理鉛筆盒; 全身側,它會倒垃圾、鋪床、整理鞋、把文件夾放進櫃子。把這些能力合起來看,宇樹正在嘗試把“具身智能大腦”概念變成一套可以在真機上驗證的模型體系。
這家公司不再只是本體強者,而是在搶開源生態話語權,對標“安卓之於手機”:底層能力保持開放,開發者圍繞其適配不同設備和場景,最終形成一個不斷擴大的生態。二、先預測“哪裡變”,再生成“怎麼動”,讓世界模型落到動作上 要取得這樣的成果並不容易。過去的VLA更像“看圖做動作”,看到物體、理解指令,再生成動作。但真實世界高度動態,一個動作往往會改變下一秒的環境,只對眼前這一幀做判斷,往往不夠。為此,宇樹把“具身推理+未來變化預測+動作學習”放進同一體系,讓機器人在動手之前,對動作可能帶來的變化形成判斷。其中一個關鍵設計,就是把“哪裡會發生變化”單獨拿出來學習。
宇樹首先利用光流,對機器人執行動作前後的畫面進行比較。比如機械臂包裝手機時,背景裡的桌子基本沒有變化,真正發生明顯變化的是機械臂、手機以及兩者發生交互的區域。模型不需要把下一幀畫面的每個像素都重新預測一遍,而是把注意力集中到這些因為機器人交互而發生變化的區域。隨後,這些變化區域被VQ-VAE壓縮成一串固定長度的離散Token。僅需給定當前畫面和任務描述(或將要執行的動作),模型就能直接預測出下一步哪些區域會變。宇樹將其稱為以交互為中心的世界建模(interaction-centric world modeling)。有了對未來變化的預測,下一步則是把這種理解真正接到機器人的動作上。
但機器人動作本身又比一句自然語言複雜得多。以人形機器人為例,一次看似簡單的“整理沙發抱枕”,就同時涉及手臂末端往哪裡移動、夾爪或者靈巧手如何開合,以及下半身如何配合調整姿態。如果把所有動作簡單塞進一個連續空間裡學習,不同身體部位之間的動作表達會非常複雜。宇樹幹脆把統一動作空間拆成三路:末端執行器位姿、末端執行器關節、下肢關節,各自用RVQ離散成Token。原本連續變化的運動軌跡,被翻譯成一套“動作語言”,機械臂怎麼走、手怎麼動、下半身怎麼配合,都有對應的Token,還按同一條時間軸同步輸入。
在UnifoLM-ER-1的基礎上,宇樹進一步把這些動作Token和前面的未來動態區域Token,與圖像、文字放進同一套表示空間,形成UnifoLM-ER-Flow。到這裡,模型既理解當前看到的世界,也能預測一次交互會讓哪裡變,還知道該採取什麼動作。但這離真正控制機器人,還差最後一步:離散Token適合模型理解和推理,真實機器人最終執行的卻是連續動作。於是到了UnifoLM-WLA-1.0,宇樹在UnifoLM-ER-Flow上加入MMDiT Action Expert,把模型對任務、未來變化和動作的理解,進一步解碼成機器人能真正執行的連續動作。
至此,一條完整鏈路形成了:機器人先預測哪裡會變,再生成怎麼動。世界模型由此參與動作生成,使人形機器人能夠把環境理解、變化預測和全身控制連接起來。三、2500小時真機數據背後:模型是公開牌,數據與場景是護城河 模型參數可以公開,真正難複製的是持續產生高質量機器人數據的能力。具身模型最大的門檻之一,是數據來自真實世界。原因在於,圖文數據可以按億為單位從互聯網上抓取,真機數據卻只能讓真實的機器人跑出來。2500小時高質量真機數據,相當於一臺機器人連續採集超過100天,而且每一幀都要真實、有效、能拿來訓練。UnifoLM-WLA-1.
0使用約2500小時真機數據訓練,數據覆蓋不同的機器人本體和作業場景。超過500萬條具身推理樣本覆蓋圖像點預測、物體檢測、多圖推理、2D軌跡預測、3D物體檢測和多圖空間問答,並與通用圖文數據共同訓練;約2500小時真機數據則用於WLA模型訓練。兩類數據對應不同訓練階段。真機數據既需要時間,也需要成規模的機器人產能。對只做模型的玩家來說,光是把機器人鋪開去採數據,就是一筆繞不開的硬投入。而另一大技術壁壘則是統一模型。
其把視覺、語言、動態區域Token和動作Token放進同一個多模態模型,再加入MMDiT Action Expert生成連續機器人動作,走出“多本體+統一動作空間”的路線,讓不同身體部位在同一時間步協同學習。所以,模型是公開牌,背後真機數據與持續產數據能力才是底牌。數據決定模型能否持續覆蓋更多任務和場景。隨著權重、代碼和數據逐步開放,開發者可以在64項任務之外繼續檢驗模型的泛化邊界,並開展二次開發和場景適配。這也意味著,宇樹提供的正在從一臺機器人,延伸到一套可以被反覆調用、適配不同任務的具身智能底座。
對行業客戶而言,這樣的底座一旦能夠被更多機器人、場景和開發者複用,其價值就不再侷限於單一硬件,而會進一步延伸到行業解決方案和平臺化能力。換句話說,開源“大腦”並沒有削弱宇樹的護城河,反而讓它進一步落到真機數據、真實場景和持續迭代能力上,再通過開放模型吸引更多開發者和生態夥伴加入。這條路跑通後,宇樹拿得出來的,是一套能持續進化、還能帶著生態一起走的底座。宇樹的前途,也由此越走越寬。結語:從定義身體到定義大腦,具身智能進入“生態卡位戰” 從四足到人形,宇樹過去一直以本體和運動能力被行業記住。如今,宇樹兩條腿走路,恰好踩在具身智能競爭的分水嶺上:拼硬件的競爭還在加碼,拼大腦、拼生態的階段也正在展開。
當模型參數和代碼都能公開,真正稀缺的是持續產出高質量真機數據的能力,以及圍繞這套體系聚集起來的開發者生態。如今,具身智能的“安卓時刻”,或許正在由國產廠商拉開帷幕。
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。