光鑑科技發佈具身智能視覺感知方案,為物理AI提供視覺感知基礎

重點摘要
隨著多模態大模型與VLA(視覺-語言-動作)等技術的快速演進,具身智能正從實驗室走向工廠、家庭與商業場景。然而,機器人能否真正融入複雜多變的物理世界,不僅取決於「大腦」的推理決策能力,更仰賴一套精準且穩定的視覺感知系統。自主導航、精細抓取、人機互動等核心功能,無不需要可靠的三維視覺作為基礎。在此背景下,光鑑科技正式發布具身智能視覺感知方案,以AI雙目視覺技術為核心,融合智能感知算法與高效計算架構,為機器人提供涵蓋環境理解、空間定位與精細操作的統一視覺能力。
隨著多模態大模型與VLA(視覺-語言-動作)等技術的快速演進,具身智能正從實驗室走向工廠、家庭與商業場景。然而,機器人能否真正融入複雜多變的物理世界,不僅取決於「大腦」的推理決策能力,更仰賴一套精準且穩定的視覺感知系統。自主導航、精細抓取、人機互動等核心功能,無不需要可靠的三維視覺作為基礎。在此背景下,光鑑科技正式發布具身智能視覺感知方案,以AI雙目視覺技術為核心,融合智能感知算法與高效計算架構,為機器人提供涵蓋環境理解、空間定位與精細操作的統一視覺能力。
傳統雙目視覺在面臨透明玻璃、高反射金屬、弱紋理牆面及黑色物體等真實場景時,常出現深度缺失與點雲噪點等問題,直接影響機器人的避障、抓取與導航表現。光鑑科技的方案引入自研高性能立體匹配算法,讓雙目視覺具備理解場景結構與物體關係的能力。在面對複雜材質時,AI雙目視覺仍能輸出邊緣連續、細節豐富且結構完整的深度信息,實現毫米級細節的穩定重建,從根本上突破傳統方案的紋理依賴瓶頸。以透明玻璃場景為例,該方案能有效結合圖像特徵與空間結構,降低透明材質帶來的匹配干擾,顯著提升深度資訊的完整性與穩定性。在倉儲或居家環境中,這樣的表現可為機器人提供更可靠的避障決策依據。
而在弱紋理場景,如牆角、白色檯面或光滑地面,方案則通過整合物體邊緣、幾何結構與空間關係,大幅減少深度異常,使高度變化與立面結構得到準確表達,強化了機器人在複雜環境中的空間理解能力。針對近距離精細操作需求,光鑑科技的視覺感知方案對於細小物體的重建尤為突出。例如,在機械臂抓取、靈巧手操作或數據採集過程中,具備更清晰輪廓與平滑表面結構的點雲輸出,能有效支撐毫米級的精準任務。官方提供的演示顯示,從長尾夾(0.1公分)到鉛筆與記號筆(0.5公分至1.5公分)等微小物體,方案均能提供豐富的視覺細節與精確的雙目約束,滿足精密操作對視覺資訊的高要求。
在系統架構層面,光鑑科技採取全域泛化感知設計,以統一硬體平台同時支撐深度感知、SLAM定位與目標檢測等多類任務。過去,不同功能往往需要獨立配置感知硬體,不僅增加成本與系統複雜度,也限制多任務協同。新的方案讓一套視覺系統即可覆蓋不同場景需求,且支援OTA持續升級,為具身智能提供了更通用且高效的視覺能力基礎。計算效率方面,該方案透過優化感知計算架構,大幅降低算力消耗。在有限的端側資源下,依然能穩定輸出高質量、高幀率的深度圖像,從而釋放更多算力服務於VLA推理與SLAM定位等核心任務。這對於算力寶貴的機器人平台而言,等於為智能決策預留了更大的升級空間,兼顧感知品質與整體效能。
具體到產品,光鑑科技推出Libra系列AI雙目視覺模組,以兩種基線設計對應不同應用場景。Libra 1000採用2公分基線,專為機械臂腕部安裝設計,服務於近距離精細操作、遙操作及數據採集,並可適配雙目魚眼鏡頭,實現超過180°水平視場,擴大近場觀測範圍。Libra 3000採用7公分基線,適用於頭部或車載空間感知,主打中遠距離避障、SLAM定位與空間建圖,也可內建空間感知算法,實現視覺採集與深度計算的一體化。兩款模組均支援GMSL高速輸出,能快速整合至主流機器人平台,從機械臂的末端操作到移動機器人的導航定位,都能以統一且高效的視覺系統支撐完整任務鏈。
這種從感知層到演算法層的深度整合,反映了光鑑科技對具身智能真實落地需求的系統性思考。從單一硬體性能競爭,到感知質量、系統協同與計算效率的綜合平衡,機器人視覺正經歷重要轉型。光鑑科技此次方案發布,不僅是一套深度相機的升級,更是一個面向物理AI時代的基礎設施佈局。未來,隨著AI算法、視覺硬體與感知計算的持續協同演進,光鑑科技致力於讓機器人更準確、更穩定地理解物理世界,進而推動具身智能加速邁向規模化的真實應用。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。