面壁智能開源MiniCPM-Robot:1.5B的VLA模型完整放出,個人開發者也能在真機器人上跑操作
重點摘要
AI資訊AI新閒資訊正文面壁智能開源MiniCPM-Robot:1.5B的VLA模型完整放出,個人開發者也能在真機器人上跑操作發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘具身智能這場仗,過去基本是巨頭和實驗室的專屬遊戲——模型太大、門檻太高,普通開發者連真實機器人都摸不著。7月19日,面壁智能(OpenBMB)把這扇門直接踹開了。
面壁智能(OpenBMB)於7月19日開源了旗下首個具身AI模型系列MiniCPM-Robot,將一套完整的視覺-語言-動作模型(VLA)連同推理框架一併釋出。這項開源動作的關鍵在於,模型參數量僅1.5B(15億),大幅降低了過去只有大型實驗室與科技巨頭才能參與的具身智能門檻,讓個人開發者也有機會在真實機器人上執行操作與目標跟蹤任務,在業界相當罕見。 過去很長一段時間,具身智能的研究幾乎被少數機構壟斷。背後原因在於模型體積過大、運算資源需求高昂,加上真實機器人硬體取得不易,一般開發者根本難以入門。面壁智能此次直接將模型參數與程式碼完整公開,等同於把這道大門徹底打開,為更多開發者提供實際動手打造的機會。 MiniCPM-Robot系列由三個核心組件構成。最主要的模型是MiniCPM-RobotManip,這是一個擁有1.5B參數的通用視覺-語言-動作模型,專門負責機器人操作任務,例如抓取、放置、推移等物體操作動作。它能夠同時處理視覺影像與自然語言指令,直接輸出對應的機械動作,讓機器人理解並執行複雜的操作指令。 另一個組件是MiniCPM-RobotTrack,這是一個專為現實世界目標跟蹤設計的緊湊型模型。當機器人需要在動態環境中鎖定特定物體或人物,並持續跟隨其位置變化時,這個模型即可接手處理。與RobotManip形成互補,讓整個系統不僅能操作物體,也能感知與追蹤目標的動態行為。 除了兩個模型,面壁智能還同步發布了高性能推理框架PhyAI,該框架專為具身模型量身打造,目的在於讓機器人真正具備理解、記憶與行動的能力。PhyAI在底層針對機器人場景進行了優化,使得上述模型在實際硬體上的推理效率更高,延遲更低,進一步縮短從研發到部署的距離。 這三者組合在一起,形成一套從感知、理解、記憶到行動的完整閉環,將具身智能從過往的論文發表與實驗室展示,一步步推向可在真實世界運作的機器人系統。對於開發者來說,最直接的好處就是立即可以取得並開始測試。所有模型權重與程式碼都託管在GitHub的公開倉庫(github.com/OpenBMB/MiniCPM-Robot),同時MiniCPM-RobotManip與MiniCPM-RobotTrack各自的權重也分別在Hugging Face平台上開放,方便開發者直接下載使用。 目前機器人領域的開發者只需將倉庫複製到本地,搭配基本的硬體環境即可開始運行模型。參數量僅1.5B的VLA模型,使其對運算平台的依賴大幅降低,即使是個人擁有的機器人平台,也有機會直接搭載並執行操作與跟蹤任務。這與過去動輒數十億甚至上百億參數的模型相比,部署難度明顯下降,從而讓更多非大型機構的團隊也能參與具身智能的開發與實驗。 從技術層面來看,MiniCPM-RobotManip作為VLA模型,核心功能在於將視覺資訊、語言理解與動作輸出整合在同一個架構內。以往機器人控制往往需要分別處理感知、規劃與控制三個獨立模組,而VLA模型透過端到端的學習,讓機器人能夠在接收到視覺畫面與人類語音指令後,直接生成機械臂或輪式底盤的動作指令,減少了中間環節的複雜度與整合難度。 MiniCPM-RobotTrack的加入則補足了動態情境中的目標鎖定需求。在許多實際應用中,機器人不僅需要靜態操作,還需要在環境變動時持續鎖定特定目標,例如跟隨特定人員、持續注視某個物體,或者在移動過程中保持對目標的視野。這個小巧的模型正好填補了這塊需求,且因為模型規模不大,能夠與RobotManip共用同一套平台,無須額外的運算資源。 PhyAI推理框架的存在,則是確保這些模型在真實機器人上能夠順暢運作的關鍵。具身模型的推理往往需要考慮物理世界的即時反饋,PhyAI針對此類場景進行了底層優化,在記憶管理、並行計算與感測器資料流等方面做了特別設計,使得機器人在執行任務時能夠更即時地反應環境變化,從而提高成功率與穩定性。 面壁智能此次選擇完整開源,包括模型權重、程式碼以及技術文件,讓開發者可以直接基於現有成果進行二次開發或修改。這種開放程度在當前具身智能領域仍然少見,多數頂尖模型仍維持封閉或部分開放的授權方式。面壁智能的做法很可能帶動更多團隊跟進,加速整個領域的技術下沉。 從時間點來看,MiniCPM-Robot的開源正好發生在具身智能討論熱度持續升高的時期。過去一年,國內外多家機構接連推出各類具身基礎模型,但多半仍停留在封閉測試或超大規模參數階段。面壁智能以1.5B模型切入,並將開源作為核心策略,在市場上走出了與其他巨頭不同的路徑,特別聚焦於降低參與門檻與提升開發者友善度。 對個人開發者與小型團隊而言,現在只需要一組常見的機器人硬體、一台具備基本算力的電腦,就有機會導入這些模型進行實驗。這可能讓許多原本只在軟體領域鑽研的開發者,第一次有機會跨入機器人操作的領域,進一步擴大整體開發者社群的多樣性與創新動能。 從長遠來看,當1.5B的VLA模型不再被鎖在實驗室內,而能在廣泛的硬體平台上運作,具身智能的發展曲線很有可能比外界預期更早迎來爆發。面壁智能這次的開源動作,或許只是第一步,但它已讓更多人有機會實際觸碰、測試與改善這些技術,最終推動機器人從特定場景的展示,走向更多元、更普及的真實應用。
Related
相關文章

阿里甩出“配音”神器:能調整情緒,還會說方言
阿里旗下的千問大模型推出語音合成工具Qwen-Audio-3.0-TTS,支援情緒調整、方言及多語種,並可透過自然語言指令控制語氣與場景。該模型在第三方評測中獲得語音合成榜單第一,具備高品質的聲音復刻與抗噪能力。

手機、座艙、具身,中國最大端側獨角獸低調交出高分卷
面壁智能作為中國最大端側獨角獸,於WAIC展示手機、汽車、機器人等端側AI落地成果,並與三星、吉利等企業合作。該公司強調端側AI產業化需超越模型本身,建立跨終端適配、生態與標準,正逐步成為端側智能產業定義者。

關於面壁智能,聊聊我的一些新思考
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

Token收費,不再“天經地義”?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

AI眼鏡繼續進化:不只看見,還要辦事
過去兩年,大模型技術加速導入智慧眼鏡,翻譯、拍攝等應用功能密集問世,成為市場主流。然而,隨著這些能力逐漸成為標配,AI眼鏡所面臨的新課題也隨之浮現——業界開始思考,如何讓眼鏡從「看見」進化到「辦事」,真正成為能主動協助用戶完成任務的隨身裝置。

16萬Star的OpenCode徹底重寫:API全部重做、Bun換Node、桌面端遷移Electron
擁有超過 16 萬顆 GitHub 星星、每月活躍開發者高達 750 萬人的開源專案 OpenCode,在 2026 年 7 月正式推出了 2.0 版本。這不僅是一次例行更新,而是從底層架構到使用者體驗的全面翻新。聯合創始人 Dax Raad 在近期受訪時坦言,這是他職業生涯中「第三次才做對」的產品:0 是原型試水,1.x 是市場驗證,而 2.0 則是在徹底理解整個領域後,從零開始的推倒重來。 這次重寫的核心變革之一,就是完全重構了應用程式介面(API)。