殺進機器人賽道,面壁智能怎麼打出差異化?對話首席科學家

2026年7月23日 04:55

重點摘要

智東西 作者 | ZeR0 編輯 | 漠影 智東西7月23日報道,在世界人工智能大會WAIC 2026期間,北京大模型獨角獸面壁智能開源了其首個具身智能技術成果MiniCPM-Robot系列模型,包括通用VLA模型MiniCPM-RobotManip與面向移動機器人跟蹤導航的MiniCPM-RobotTrack,正式進軍機器人領域。

站內 AI 整理稿

面壁智能正式跨足機器人領域,並在2026年世界人工智能大會(WAIC)期間,開源了其首個具身智能技術成果——MiniCPM-Robot系列模型。這組模型包含通用視覺語言動作模型(VLA)MiniCPM-RobotManip,以及專為移動機器人跟蹤導航設計的MiniCPM-RobotTrack,標誌著這家北京大模型獨角獸正式從純語言模型與多模態模型,延伸至物理世界的感知與操作。成立於2022年8月的面壁智能,過去一年成長極為迅速。今年上半年累計融資已超過50億元人民幣,估值突破200億元,是目前中國端側智能領域公開估值最高的獨角獸企業。

公司長期專注於小參數量的高效能多模態模型,並以「端側AI」為核心策略,如今將這套技術邏輯帶入機器人賽道,試圖以更輕量、更低成本的方案,與市面上參數量動輒數十億甚至上百億的機器人模型做出差異化。MiniCPM-RobotManip的訓練基礎,來自面壁智能最新發布的多模態端側模型MiniCPM-V 4.6。這款模型延續了面壁一貫的「小尺寸、高性能」路線,尤其擅長對視覺Token進行極致壓縮,使得模型在極簡的運算資源下仍能維持高品質的視覺理解。MiniCPM-RobotManip僅以1.5B的參數量,就能達到比肩3B至4B規模模型的表現,但流式實時推理的計算成本足足降低一半。

更關鍵的是,它支援長達1分鐘的具身原生記憶,讓機器人在執行任務時,能記住前後文脈絡,例如先拿起A物體再放到B位置這類需要連續記憶的操作,都能高效完成。另一款模型MiniCPM-RobotTrack,則是由面壁智能與南京大學共同研發,專門針對移動機器人的跟蹤與導航場景。這款模型宣稱是業界首個支援真實本地斷網部署的跟蹤模型,換句話說,機器人不需要連上雲端伺服器,僅靠自身的運算單元與攝影機,就能完成純視覺的自主指令追蹤。這項能力對於在工廠、倉儲、物流等網路環境不穩定的場域中運作的機器人來說,意義重大。

MiniCPM-RobotTrack原生適配宇樹科技的Go2 Edu四足機器人,僅依靠Go2 Edu原裝的攝影機與本地算力,就能夠執行單目標、動態多目標以及模糊目標的跟蹤任務。在實測中,它能夠穩定維持5 Hz以上的更新頻率,端到端響應時延約為180毫秒,這對於需要即時反應的移動機器人來說,已經相當接近實用門檻。此外,研發團隊還為這套模型建立了自進化數據管線,機器人在實際運作過程中,可以持續蒐集新的場景數據,回饋到訓練流程中,讓模型在複雜動態環境下的跟蹤能力不斷提升。面壁智能選擇將這兩款模型開源,背後有明確的戰略考量。

目前機器人領域的VLA模型大多集中在學術界與少數大型企業手中,開源社群中缺乏真正輕量、可部署在邊緣裝置上的方案。面壁智能希望透過開源MiniCPM-Robot系列,吸引更多開發者與機器人硬體廠商加入,在端側機器人生態中建立自己的標準與影響力。這與該公司過去在端側語言模型上的策略一脈相承——先以開源建立社群信任,再透過商業化服務與客製化方案獲取營收。從技術架構來看,MiniCPM-RobotManip與MiniCPM-RobotTrack都保留了面壁智能在端側模型上的核心優勢:極小的體積、極低的推理成本、以及對記憶與上下文的理解能力。

這些特質使得它們特別適合搭載在資源受限的機器人平台上,例如小型四足機器人、輪式服務機器人、甚至機械手臂。而傳統上,機器人若要執行複雜的視覺語言任務,往往需要仰賴雲端算力或高階GPU,成本與功耗都居高不下。面壁智能的切入點,正是試圖打破這個瓶頸。值得注意的是,MiniCPM-RobotManip支援的1分鐘具身原生記憶,並非簡單的影片緩存,而是模型在理解視覺輸入後,能夠將關鍵資訊壓縮並保留在內部狀態中,類似人類短期記憶的運作方式。這項能力讓機器人在執行多步驟任務時,不會因為畫面切換或物體移動而遺忘先前的指令或環境狀態。

例如,在自動化組裝產線上,機器人可以先識別零件A,記住它的位置,再移動到另一個區域夾取工具B,最後回到原處進行組裝,整個流程不需要外部指令反覆下達。在移動機器人方面,MiniCPM-RobotTrack的純視覺本地跟蹤方案,也解決了過去依賴GPS、UWB或雷射雷達的痛點。這些傳統定位技術在室內、地下或鋼結構密集的環境中容易失效,而純視覺方案只要光線充足,就能夠持續鎖定目標。面壁智能與南京大學的團隊在訓練數據中加入了大量動態遮擋、光線變化、目標外觀改變等對抗性樣本,讓模型在真實場景中更具魯棒性。目前,這兩個模型的開源程式碼已上傳至GitHub,供開發者下載與測試。

面壁智能方面表示,未來將持續迭代MiniCPM-Robot系列,並計畫擴展到更多機器人硬體平台,包括輪式機器人、人形機器人以及服務型機械臂。同時,公司也正在與多家機器人製造商洽談合作,將這些模型整合到量產產品中。隨著大模型技術從雲端走向終端,從文字圖像走進物理世界,面壁智能的機器人模型開源,代表著端側AI與具身智能的邊界正在模糊。而這家成立僅四年的獨角獸,能否在機器人賽道中複製其在端側語言模型上的成功,將取決於開發者社群的反饋速度,以及硬體合作夥伴的落地進度。至少從技術規格來看,MiniCPM-Robot系列已經在成本、記憶與即時性上,提出了與市場主流方案截然不同的差異化路線。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

6 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

8 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

11 小時前