1.5B開源通用VLA模型,衝進具身智能第一梯隊

重點摘要
面壁智能推出開源通用VLA模型MiniCPM-Robot,參數規模1.5B,整合視覺、語言與動作生成,為具身智慧提供輕量高效方案。此舉讓該公司進入具身智慧第一梯隊,並透過開源策略降低研究門檻加速應用落地。
面壁智能近日正式推出 MiniCPM-Robot 系列模型,這是一款擁有 1.5B 參數的開源通用 VLA(視覺-語言-動作)模型,標誌著該公司在具身智慧領域的重大突破。透過整合視覺理解、語言處理與動作生成於單一架構,MiniCPM-Robot 為機器人與多模態 AI 的融合提供了一條輕量且高效的技術路徑,也讓面壁智能一舉進入具身智慧的第一梯隊。VLA 模型是近年來機器人學習領域的熱門方向,其核心在於讓模型能夠同時處理視覺影像、自然語言指令,並直接輸出對應的機器人動作指令。傳統做法往往需要分別訓練視覺模型、語言模型與控制策略,再透過複雜的管線串接,不僅開發門檻高,也難以在真實場景中穩定運行。
MiniCPM-Robot 則將三個模組統合在一個端到端的框架內,大幅簡化了系統設計,同時保持了良好的泛化能力。面壁智能此次選擇以 1.5B 參數規模切入,而非追求更大的模型,背後有明確的技術考量。在機器人領域,模型需要部署在邊緣設備或具備即時反應需求的平台上,參數過大往往導致推理延遲過高,無法滿足實際操作的要求。1.5B 的規模在當前開源 VLA 模型中屬於輕量級,卻能在多項標準測試中展現出與更大規模模型相當的表現,甚至在某些任務上超越同級別競品,讓它成為兼顧效能與實用性的選擇。MiniCPM-Robot 的發布也補齊了面壁智能在機器人與多模態 AI 之間的技術拼圖。
該公司過去在語言模型與視覺語言模型上已有深厚積累,但缺乏將這些能力直接轉化為機器人動作的橋梁。如今透過 VLA 架構,面壁智能得以將理解能力延伸至物理世界,讓模型不僅能看懂、聽懂,還能實際動手操作,這對其在智慧製造、家用服務、教育科研等領域的布局極具戰略意義。開源策略是 MiniCPM-Robot 的另一大亮點。面壁智能將模型權重、訓練程式碼以及部分使用範例公開釋出,讓全球的研究者與開發者都能免費下載使用。這項舉措有效降低了進入 VLA 研究的門檻,過去只有少數擁有大量算力與數據的頂尖實驗室才能從事相關開發,如今更多中小型團隊、甚至個人開發者都能在此基礎上進行二次開發或應用實驗。
業界普遍認為,開源將加速通用 VLA 模型從實驗室走向真實場景的進程。在具體技術細節上,MiniCPM-Robot 採用多模態編碼器融合視覺與語言特徵,並透過一個輕量化的動作解碼器將這些特徵映射為機器人關節角度、末端執行器位置等連續控制訊號。訓練過程中,團隊使用了大量模擬環境與真實遙操作數據,並設計了專門的數據增強策略,以提高模型在不同光照、背景、物體排列下的穩定性。此外,模型還支援零樣本適應,即在未經特定場景微調的情況下,也能對新環境產生合理的動作預測。
效能方面,面壁智能公布的測試結果顯示,MiniCPM-Robot 在多個具身智慧基準任務中,例如桌面操作、物品抓取、簡單組裝等,均達到或接近當前最先進的閉源模型水準。特別是在需要語言指令理解的場景中,模型能夠準確對應「把紅色方塊放到藍色杯子左邊」這類複雜敘述,顯示出優秀的語意與空間推理能力。這對於家庭服務機器人或協作型機器人而言,是極具實用價值的特性。值得注意的是,MiniCPM-Robot 並非僅針對單一機器人平台設計。面壁智能表示,該模型支援多種常見的機械臂與移動底盤架構,使用者只需提供對應的運動學參數與控制介面,即可快速完成部署。
這種靈活性讓它不僅適用於實驗室研究,也為產業界提供了可複用的技術基底,有望縮短機器人應用從概念驗證到量產的週期。面壁智能此次進軍具身智慧,也反映了業界對於通用機器人智慧化路線的共識轉變。過去機器人控制往往依賴手工編寫的規則或基於強化學習的專用策略,難以適應多變的任務與環境。而 VLA 模型憑藉大規模預訓練所獲得的常識與語意理解能力,開始展現出更強的泛化性,讓機器人能夠像人類一樣「看一次、聽一次就學會動作」。MiniCPM-Robot 的輕量開源特性,正是為了讓這條路線能被更多團隊驗證與迭代。
從市場競爭格局來看,具身智慧領域目前已有不少玩家投入 VLA 或類似技術的研發,但多數模型規模較大、封閉性較強。面壁智能以 1.5B 開源模型切入,不僅避開了與巨頭在算力上的正面競爭,也精準瞄準了中小團隊與學術機構的需求。這項策略若能配合持續的社群生態經營,有機會在開源社群中形成正循環,吸引更多貢獻者共同改進模型,進一步鞏固其在第一梯隊的地位。總體而言,MiniCPM-Robot 的推出不僅是面壁智能技術版圖的關鍵補強,也為開源具身智慧領域注入了一股清新的活力。透過降低門檻、保持輕量、開放授權,該模型有望加速通用 VLA 技術的落地進程,讓更多機器人能夠真正理解人類意圖並自主行動。
未來,隨著社群回饋與場景數據的累積,MiniCPM-Robot 系列或許將迭代出更強大的版本,持續推動具身智慧從實驗室走進日常生活。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。