小米開源具身生成大模型U0,要給機器人批量“造數據”

重點摘要
小米於7月15日發布並開源具身生成大模型U0,擁有380億參數,旨在透過生成、遷移與擴增技術,為機器人批量製造訓練數據。該模型可將真實數據更換場景與物體,並加速生成高解析度訓練圖片,效率提升82.9倍,有助於降低機器人研發成本,加速其落地應用。
小米於7月15日正式發布並開源具身生成模型Xiaomi-Robotics-U0,簡稱U0,將大模型能力進一步延伸至機器人領域。這款模型擁有380億參數,採用多模態自迴歸架構,將具身世界建模與通用圖像生成能力整合在同一框架中,主要目標是為機器人訓練提供高效、低成本的大量仿真數據。機器人要在真實世界中學會抓取、搬運、整理等動作,需要反覆在各種場景中進行訓練。然而,現實世界的數據採集成本極高,週期長,尤其是一些危險、極端或低頻出現的場景,很難透過傳統方式充分覆蓋。U0的設計正是為了解決這個痛點,試圖將數據生成過程轉變為一條可批量運行的生產線。
具體來說,有了U0,機器人已經採集到的真實操作數據,可以直接更換其中的物體、光照、材質和背景,無需重新搭建場景、部署設備並重複採集。對於那些現實中難以獲得的長尾場景,模型也能根據需求直接生成相應的訓練數據。這項能力大幅降低了數據擴充的門檻與時間成本。為了提升生成效率,U0還提出了FlashAR與高速推理加速方案。透過對角並行解碼與緩存調度技術,模型將一張1024×1024解析度的高清訓練圖片生成時間,從原本的450.77秒壓縮至5.44秒,效率提升達82.9倍。這意味著機器人公司可以在極短時間內,批量產出覆蓋不同背景、光照條件與物體組合的訓練數據。
U0的功能涵蓋四大類任務:具身場景生成、具身軌跡遷移、機器人交互視頻生成,以及通用的文生圖與圖像編輯。這四項任務統一在一個模型之中,基本貫通了「生成場景—遷移軌跡—擴展環境—生成交互過程」的完整數據生產鏈路。開發者可以透過U0快速建立虛擬訓練環境,並將機器人的動作軌跡轉移到新場景中,進一步提高模型在真實環境中的適應能力。事實上,開源模式在具身智能領域並非首例。2025年3月,群核科技曾開源空間理解模型SpatialLM,該模型能將影片或點雲資料轉化為包含牆體、門窗、傢俱以及空間關係的結構化三維場景。企業可針對自身需求進行微調,藉此提升機器人對物理空間的理解能力。
這類開源嘗試顯示,業界正積極透過共享基礎模型來降低研發門檻。當前,具身智能行業仍面臨訓練數據不足、場景覆蓋有限以及研發成本高昂等挑戰。開源模型雖然無法完全取代真實機器人採集的數據,也無法解決所有複雜的物理交互問題,但確實能在一定程度上降低數據擴充與模型訓練的成本,加快機器人從實驗室走向工廠、倉庫和家庭等真實場景的進程。小米此次開源U0,不僅為自身機器人研發提供數據支撐,也讓更多開發者與研究機構能夠利用這套工具進行實驗與應用。隨著類似模型不斷湧現,機器人訓練數據的取得方式正逐步從「重資產、高人力」的傳統模式,轉向「輕量化、可複製」的生成式生產路徑。
業界認為,這將有助於加速具身智能技術的迭代與落地。值得注意的是,U0的發布時間點選在7月,距離小米先前在機器人領域的布局已有數年。小米旗下機器人產品,如CyberDog與CyberOne,均已在市場上引起關注。此次將大模型能力與機器人訓練數據生成結合,顯示小米正試圖從硬體製造向上游軟體工具鏈延伸,打造更完整的技術生態。整體而言,U0的開源為機器人社群提供了一個實用工具,尤其對中小型機器人新創公司而言,可以大幅降低數據準備的初期投入。未來若能持續最佳化生成數據與真實場景之間的差距,這類模型將有機會成為具身智慧發展的重要基礎設施。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。