全天候科技生成式AI

小米開源具身生成大模型U0,要給機器人批量“造數據”

2026年7月15日 18:07
小米開源具身生成大模型U0,要給機器人批量“造數據”

重點摘要

小米於7月15日發布並開源具身生成大模型U0,擁有380億參數,旨在透過生成、遷移與擴增技術,為機器人批量製造訓練數據。該模型可將真實數據更換場景與物體,並加速生成高解析度訓練圖片,效率提升82.9倍,有助於降低機器人研發成本,加速其落地應用。

站內 AI 整理稿

小米於7月15日正式發布並開源具身生成模型Xiaomi-Robotics-U0,簡稱U0,將大模型能力進一步延伸至機器人領域。這款模型擁有380億參數,採用多模態自迴歸架構,將具身世界建模與通用圖像生成能力整合在同一框架中,主要目標是為機器人訓練提供高效、低成本的大量仿真數據。機器人要在真實世界中學會抓取、搬運、整理等動作,需要反覆在各種場景中進行訓練。然而,現實世界的數據採集成本極高,週期長,尤其是一些危險、極端或低頻出現的場景,很難透過傳統方式充分覆蓋。U0的設計正是為了解決這個痛點,試圖將數據生成過程轉變為一條可批量運行的生產線。

具體來說,有了U0,機器人已經採集到的真實操作數據,可以直接更換其中的物體、光照、材質和背景,無需重新搭建場景、部署設備並重複採集。對於那些現實中難以獲得的長尾場景,模型也能根據需求直接生成相應的訓練數據。這項能力大幅降低了數據擴充的門檻與時間成本。為了提升生成效率,U0還提出了FlashAR與高速推理加速方案。透過對角並行解碼與緩存調度技術,模型將一張1024×1024解析度的高清訓練圖片生成時間,從原本的450.77秒壓縮至5.44秒,效率提升達82.9倍。這意味著機器人公司可以在極短時間內,批量產出覆蓋不同背景、光照條件與物體組合的訓練數據。

U0的功能涵蓋四大類任務:具身場景生成、具身軌跡遷移、機器人交互視頻生成,以及通用的文生圖與圖像編輯。這四項任務統一在一個模型之中,基本貫通了「生成場景—遷移軌跡—擴展環境—生成交互過程」的完整數據生產鏈路。開發者可以透過U0快速建立虛擬訓練環境,並將機器人的動作軌跡轉移到新場景中,進一步提高模型在真實環境中的適應能力。事實上,開源模式在具身智能領域並非首例。2025年3月,群核科技曾開源空間理解模型SpatialLM,該模型能將影片或點雲資料轉化為包含牆體、門窗、傢俱以及空間關係的結構化三維場景。企業可針對自身需求進行微調,藉此提升機器人對物理空間的理解能力。

這類開源嘗試顯示,業界正積極透過共享基礎模型來降低研發門檻。當前,具身智能行業仍面臨訓練數據不足、場景覆蓋有限以及研發成本高昂等挑戰。開源模型雖然無法完全取代真實機器人採集的數據,也無法解決所有複雜的物理交互問題,但確實能在一定程度上降低數據擴充與模型訓練的成本,加快機器人從實驗室走向工廠、倉庫和家庭等真實場景的進程。小米此次開源U0,不僅為自身機器人研發提供數據支撐,也讓更多開發者與研究機構能夠利用這套工具進行實驗與應用。隨著類似模型不斷湧現,機器人訓練數據的取得方式正逐步從「重資產、高人力」的傳統模式,轉向「輕量化、可複製」的生成式生產路徑。

業界認為,這將有助於加速具身智能技術的迭代與落地。值得注意的是,U0的發布時間點選在7月,距離小米先前在機器人領域的布局已有數年。小米旗下機器人產品,如CyberDog與CyberOne,均已在市場上引起關注。此次將大模型能力與機器人訓練數據生成結合,顯示小米正試圖從硬體製造向上游軟體工具鏈延伸,打造更完整的技術生態。整體而言,U0的開源為機器人社群提供了一個實用工具,尤其對中小型機器人新創公司而言,可以大幅降低數據準備的初期投入。未來若能持續最佳化生成數據與真實場景之間的差距,這類模型將有機會成為具身智慧發展的重要基礎設施。

Related

相關文章

MarkTechPost AI生成式AI

騰訊雲開源 TencentDB Agent Memory v2.0:專為 AI 編碼代理打造的團隊級記憶中樞

騰訊雲已開源 TencentDB Agent Memory v2.0,這是一個專為 AI 代理設計的團隊級記憶中樞。其概念非常簡單:如果專案背景已解釋過一次,新會話便無需重複說明。此係統可將對話、文件和程式碼轉化為四種可重複使用的記憶資產——Chat Memory、Skill、LLM-Wiki 和 Code-Graph——這些資產均具備版本控制、權限管理,並可指定給特定代理使用。單一代理記憶並非新概念,此處的新穎之處在於治理層,它允許團隊成員的代理讀取你的代理所學到的內容,同時不會洩漏任何你標記為私密的資訊。穩定的 2.0.0 版本已於 2026 年 8 月 3 日發布。是否可部署?是的,可部署。TencentDB Agent Memory 採用 MIT 授權,並支援自架部署。三個 Docker 映像檔已發布至 Docker Hub,起始於……

11 分鐘前
MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

51 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前