機器人視覺迎來新突破!螞蟻靈波空間感知模型LingBot-Depth 2.0正式發佈
重點摘要
螞蟻集團旗下靈波科技發佈空間感知模型LingBot-Depth 2.0,訓練數據從300萬擴充至1.5億,在多項深度補全測評中取得佳績,深度誤差較上一代減半。同步推出的視覺基座模型LingBot-Vision,以邊界結構為預訓練目標,開源多版本,並與奧比中光合作推動商業化落地。
螞蟻集團旗下專注於具身智能的靈波科技於7月7日正式發表新一代空間感知模型LingBot-Depth 2.0。該模型以1.5億筆數據規模進行訓練,在邊緣清晰度、微小物體辨識、遠距離深度估計以及複雜場景的強固性等面向全面升級,為機器人視覺技術再添重要突破。LingBot-Depth系列是靈波科技自主研發的空間感知模型,可視為機器人在物理世界中的「眼睛」。前一代的1.0版本已解決了機器人在透明、反光等棘手場景下的空間感知難題;全新2.0版本則進一步將訓練數據從300萬筆大幅擴充至1.5億筆,從而在各項性能指標上展現出顯著躍升。在深度補全基準測試的16項評比中,LingBot-Depth 2.
0拿下12項第一;特別是在難度最高的室內大面積深度缺失場景,深度誤差(RMSE)從上一代的0.132減半至0.062,成果相當突出。此外,玻璃、鏡面及透明物體等傳統深度相機容易失靈的場景,該模型的表現尤其亮眼,證明其能夠有效補全完整、平整的三維結構。同步推出的視覺基座模型LingBot-Vision則為機器人建構起從「看懂」到「看準」的能力鏈。LingBot-Vision是業內首個將「邊界結構」設為預訓練目標的通用視覺基礎模型,打破以往空間感知訓練的框架,具備亞像素等級的邊界定位與空間結構理解能力,能提供更高精度且穩定的空間感知。LingBot-Vision的預訓練語料僅使用1.
6億張圖像,規模比DINOv3小一個數量級,但深度估計精度不僅不遜色,甚至更加優異;同時其對物體邊界的判定具有高度穩定性,可在影片中連續追蹤物體邊界。此次開源的四個版本包括ViT-G、ViT-L、ViT-B與ViT-S,並支援「一模多用」,除了作為LingBot-Depth 2.0的訓練基礎,也具備通用視覺能力。在實際應用驗證方面,LingBot-Depth 2.0已通過奧比中光深度視覺實驗室的專業認證。
基於奧比中光Gemini 330系列雙目3D相機所提供的晶片級原始數據,測試結果顯示該模型在邊緣清晰度、物體輪廓完整性、微小物體辨識、遠距離深度估計,以及複雜光線與材質場景下的抗干擾能力等項目均有明顯提升。商業化進程也同步加速。靈波科技與奧比中光已在多方面展開深度合作。奧比中光最新推出的無本體數據採集產品中,RGB-D版本的EGO設備將搭載靈波科技針對資料採集場景優化的LingBot-Depth版本,未來還會進一步整合更高階的商業版模型,持續進行深度缺失補全、邊緣與空間結構優化,為具身智能模型訓練提供更精準穩定的真實世界數據。
此外,奧比中光預計將推出整合LingBot-Depth最新模型能力的SDK產品,讓搭載Gemini 330系列相機的機器人能在端側獲得更好的深度效果;並計劃於年底前推出內建LingBot-Depth商業版的一體化相機,實現「3D相機+空間感知能力」一次到位。靈波科技也積極擁抱開放生態,此次兩款模型的技術報告與LingBot-Vision的模型權重均已開源。該公司先前已先後開源具身大模型LingBot-VLA及其後訓練工具鏈,協助開發者用少量示教數據快速將模型遷移至不同機器人與任務,進一步降低產業進入門檻。
靈波科技表示,期望以開放方式與業界共同打造機器人視覺底座,突破機器人在真實世界中「看懂、看準、看穩」的瓶頸,加速具身智慧領域的規模化落地。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。