1.5B開源通用VLA模型,衝進具身智能第一梯隊

重點摘要
面壁智能推出開源通用VLA模型MiniCPM-Robot,參數規模1.5B,整合視覺、語言與動作生成,為具身智慧提供輕量高效方案。此舉讓該公司進入具身智慧第一梯隊,並透過開源策略降低研究門檻加速應用落地。
面壁智能近日正式推出 MiniCPM-Robot 系列模型,這是一款擁有 1.5B 參數的開源通用 VLA(視覺-語言-動作)模型,標誌著該公司在具身智慧領域的重大突破。透過整合視覺理解、語言處理與動作生成於單一架構,MiniCPM-Robot 為機器人與多模態 AI 的融合提供了一條輕量且高效的技術路徑,也讓面壁智能一舉進入具身智慧的第一梯隊。 VLA 模型是近年來機器人學習領域的熱門方向,其核心在於讓模型能夠同時處理視覺影像、自然語言指令,並直接輸出對應的機器人動作指令。傳統做法往往需要分別訓練視覺模型、語言模型與控制策略,再透過複雜的管線串接,不僅開發門檻高,也難以在真實場景中穩定運行。MiniCPM-Robot 則將三個模組統合在一個端到端的框架內,大幅簡化了系統設計,同時保持了良好的泛化能力。 面壁智能此次選擇以 1.5B 參數規模切入,而非追求更大的模型,背後有明確的技術考量。在機器人領域,模型需要部署在邊緣設備或具備即時反應需求的平台上,參數過大往往導致推理延遲過高,無法滿足實際操作的要求。1.5B 的規模在當前開源 VLA 模型中屬於輕量級,卻能在多項標準測試中展現出與更大規模模型相當的表現,甚至在某些任務上超越同級別競品,讓它成為兼顧效能與實用性的選擇。 MiniCPM-Robot 的發布也補齊了面壁智能在機器人與多模態 AI 之間的技術拼圖。該公司過去在語言模型與視覺語言模型上已有深厚積累,但缺乏將這些能力直接轉化為機器人動作的橋梁。如今透過 VLA 架構,面壁智能得以將理解能力延伸至物理世界,讓模型不僅能看懂、聽懂,還能實際動手操作,這對其在智慧製造、家用服務、教育科研等領域的布局極具戰略意義。 開源策略是 MiniCPM-Robot 的另一大亮點。面壁智能將模型權重、訓練程式碼以及部分使用範例公開釋出,讓全球的研究者與開發者都能免費下載使用。這項舉措有效降低了進入 VLA 研究的門檻,過去只有少數擁有大量算力與數據的頂尖實驗室才能從事相關開發,如今更多中小型團隊、甚至個人開發者都能在此基礎上進行二次開發或應用實驗。業界普遍認為,開源將加速通用 VLA 模型從實驗室走向真實場景的進程。 在具體技術細節上,MiniCPM-Robot 採用多模態編碼器融合視覺與語言特徵,並透過一個輕量化的動作解碼器將這些特徵映射為機器人關節角度、末端執行器位置等連續控制訊號。訓練過程中,團隊使用了大量模擬環境與真實遙操作數據,並設計了專門的數據增強策略,以提高模型在不同光照、背景、物體排列下的穩定性。此外,模型還支援零樣本適應,即在未經特定場景微調的情況下,也能對新環境產生合理的動作預測。 效能方面,面壁智能公布的測試結果顯示,MiniCPM-Robot 在多個具身智慧基準任務中,例如桌面操作、物品抓取、簡單組裝等,均達到或接近當前最先進的閉源模型水準。特別是在需要語言指令理解的場景中,模型能夠準確對應「把紅色方塊放到藍色杯子左邊」這類複雜敘述,顯示出優秀的語意與空間推理能力。這對於家庭服務機器人或協作型機器人而言,是極具實用價值的特性。 值得注意的是,MiniCPM-Robot 並非僅針對單一機器人平台設計。面壁智能表示,該模型支援多種常見的機械臂與移動底盤架構,使用者只需提供對應的運動學參數與控制介面,即可快速完成部署。這種靈活性讓它不僅適用於實驗室研究,也為產業界提供了可複用的技術基底,有望縮短機器人應用從概念驗證到量產的週期。 面壁智能此次進軍具身智慧,也反映了業界對於通用機器人智慧化路線的共識轉變。過去機器人控制往往依賴手工編寫的規則或基於強化學習的專用策略,難以適應多變的任務與環境。而 VLA 模型憑藉大規模預訓練所獲得的常識與語意理解能力,開始展現出更強的泛化性,讓機器人能夠像人類一樣「看一次、聽一次就學會動作」。MiniCPM-Robot 的輕量開源特性,正是為了讓這條路線能被更多團隊驗證與迭代。 從市場競爭格局來看,具身智慧領域目前已有不少玩家投入 VLA 或類似技術的研發,但多數模型規模較大、封閉性較強。面壁智能以 1.5B 開源模型切入,不僅避開了與巨頭在算力上的正面競爭,也精準瞄準了中小團隊與學術機構的需求。這項策略若能配合持續的社群生態經營,有機會在開源社群中形成正循環,吸引更多貢獻者共同改進模型,進一步鞏固其在第一梯隊的地位。 總體而言,MiniCPM-Robot 的推出不僅是面壁智能技術版圖的關鍵補強,也為開源具身智慧領域注入了一股清新的活力。透過降低門檻、保持輕量、開放授權,該模型有望加速通用 VLA 技術的落地進程,讓更多機器人能夠真正理解人類意圖並自主行動。未來,隨著社群回饋與場景數據的累積,MiniCPM-Robot 系列或許將迭代出更強大的版本,持續推動具身智慧從實驗室走進日常生活。
Related
相關文章

我做了個新聞聯播版《甄嬛傳》,全靠這款字節模型
字節跳動推出音頻創作模型Seed Audio 1.0,可透過提示詞生成包含對白、音效與環境聲的完整聲音場景,並支援多語種與角色一致性。實際測試顯示,該模型在聲音模仿、複雜場景編排表現突出,但部分音頻仍帶有AI感,情緒細節與真實度有待提升。

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了
李飛飛團隊發表首篇機器人觸覺感知論文,機器人可透過盲摸方式辨識麻將牌,展現缺乏視覺下的精細物件分類能力。該技術與SHARPA靈巧手結合,提供高解析度觸覺感測,為物理AI的感知能力開創新路徑,未來可應用於黑暗、高粉塵等視線受阻環境。

研究:AI 會削弱人類批判性思維,降低人們說“我不知道”的意願
首頁 > 智能時代>人工智能 研究:AI 會削弱人類批判性思維,降低人們說“我不知道”的意願 2026/7/20 20:29:11 來源:IT之家 作者:遠洋 責編:遠洋 評論: 感謝IT之家網友 Coje_He 的線索投遞! IT之家 7 月 20 日消息,2026 年,AI 依然會出現“幻覺”(hallucination),並且經常給出錯誤答案。

AI領走埃爾德什100美元賞金,44頁頂刊沒解的題,它一頁紙答出
這篇消息聚焦「AI領走埃爾德什100美元賞金,44頁頂刊沒解的題,它一頁紙答出」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

國傢俱身智能應用中試基地發佈首個合作世界模型 魔芯科技MoWorld 3D正式亮相
國家級具身智能應用中試基地近日宣布,正式發布其首個合作世界模型,並同步公開魔芯科技所開發的 MoWorld 3D 產品。這項合作標誌著中試基地在具身智能領域的技術驗證與應用落地邁出關鍵一步,也為 3D 世界模型的商業化路徑提供新的參考案例。 MoWorld 3D 由魔芯科技打造,是一款專注於三維空間理解與生成的世界模型。

Token工廠、世界模型、AI手機,WAIC的三大新風向
2024年世界人工智能大會揭示三大新風向:Token工廠、世界模型及AI手機,代表AI從技術突破轉向基礎設施與終端整合。國產算力集團軍正式亮相,展現中國在算力自主化上的集體進展,具身智能也宣告進入實際場景部署階段。