雷峰網AI Agent

RSS-2026 | 港科大(廣州)開源首個無需訓練的開放詞彙3D佔據地圖構建系統|RRS 2026

2026年8月3日 08:30

重點摘要

來源:機器之心原文鏈接:https://mp.weixin.qq.com/s/4e6qXfhfbrNKuJOpRCQqtw從第一視角觀測中持續重構三維世界,並理解空間中的幾何結構與開放語義信息,是機器人具身感知領域的核心問題。

站內 AI 整理稿

**RSS 2026 | 港科大(广州)等开源首个无需训练的开放词汇3D占据地图构建系统**

近日,香港科技大学(广州)陈昶昊教授团队联合穆罕默德·本·扎耶德人工智能大学(MBZUAI)研究者,提出了名为 FreeOcc 的开放词汇三维占据预测系统。该系统被机器人领域旗舰会议 Robotics: Science and Systems(RSS 2026)接收,源代码与数据集现已全面开源。FreeOcc 是首个无需训练即可运行的通用占据预测框架,仅依靠单目或 RGB-D 图像序列,就能在未知环境中在线构建全局一致的开放词汇三维占据地图。 语义占据预测是机器人具身感知领域的核心问题之一。它将连续空间划分为三维体素网格,并为每个体素估计“空闲、占据、未知”状态以及对应的语义类别,从而为机器人导航、避障与交互操作提供统一的场景表达。然而,现有方法大多依赖大规模三维占据标注、逐体素语义标注以及精确相机位姿,这些数据在真实开放环境中往往难以获取。当机器人进入全新场景时,既没有预标注的三维真值,也没有可靠的全局轨迹,更不可能针对每个新环境重新训练模型。因此,如何构建强泛化能力、真正适应开放环境的占据预测系统,已成为具身智能面临的关键挑战。 FreeOcc 的核心思想是彻底摆脱“针对特定数据集训练一个神经网络”的范式。它不是另一个端到端模型,而是一个模块化通用感知系统:以 SLAM 提供全局一致的几何位姿和点云锚点,以三维高斯溅射(3DGS)表达稠密连续几何,以预训练视觉语言模型注入开放词汇语义,最后通过概率投影生成可被任意自然语言查询的体素占据地图。整个流程无需任何任务特定训练,也不要求输入真实相机位姿,真正实现了“进入新场景即可感知”。 在技术实现上,FreeOcc 面临了一系列独特难点。首先是三维高斯溅射表达与占据预测目标之间的鸿沟。现有 3DGS 系统通常以图像渲染质量为目标,高斯位置、尺度、透明度存在大量等价的几何解。用这类高斯场直接做体素占据预测,会出现边界模糊、薄结构漂移和全局拓扑不稳定。为此,FreeOcc 提出了几何感知初始化(G-ini)与几何锚定高斯更新(GAGU)。高斯中心被严格锚定在 SLAM 重建的三维点上,并沿观测射线方向进行各向异性展开,使其形状符合真实成像几何,从而保证高斯场既支持高质量渲染,也支持稳定的空间推理。 其次是评估机制的缺失。基于 SLAM 的系统通常需要 Sim(3) 或 SE(3) 对齐,但标准 3DGS 优化会联合更新位置、旋转、尺度、透明度以及稠密化参数,优化后的高斯场已经不再是纯刚体结构,仅靠群变换无法完全吸收局部误差。FreeOcc 提出了统一的可对齐、可泛化、可量化评估机制,使得占据预测性能能够在不同轨迹、尺度和坐标系下得到公平比较。同时,论文还构建了 ReplicaOcc 基准数据集,用以弥补现有占据数据集中多类别被合并、开放语义无法量化的问题。 在框架设计上,FreeOcc 采用四层模块化地图表示,并在机器人观测过程中持续联合更新。第一层是点云地图:系统利用 DROID-SLAM 等视觉定位与建图算法,从单目或 RGB-D 图像中估计相机位姿,构建半稠密全局点云,为后续地图提供统一坐标系。补充实验还验证了 MASt3R-SLAM 和 VGGT-SLAM 作为骨干的性能。第二层是 3DGS 地图:以 SLAM 点云为几何锚点,初始化并更新三维高斯体,通过连续场补充稀疏几何结构。 第三层是语义地图:FreeOcc 使用预训练视觉语言模型从二维图像中提取语言对齐的开放词汇特征,借助 SLAM 的几何对应关系,将像素级语义嵌入提升到三维高斯基元上。每个高斯体不仅携带几何和外观属性,也携带语言语义信息,从而形成“语言嵌入高斯”。第四层是占据地图:系统通过概率式高斯至占据投影,将连续高斯场转换为离散体素网格。对于每个体素,基于邻域高斯混合模型计算占据概率和语义分数,最终输出可以响应任意文本查询的三维占据地图。 实验结果表明,FreeOcc 在 EmbodiedOcc-ScanNet 上取得了极具竞争力的性能。现有自监督方法 GaussianOcc 和 GaussTR 虽然不依赖语义占据监督,但依然需要真实相机位姿作为输入,其 IoU/mIoU 分别仅为 10.17/4.34 和 15.63/4.95。FreeOcc 完全不需要真值位姿,在单目输入下达到 31.29 IoU / 13.86 mIoU,RGB-D 输入下达到 34.40 IoU / 15.84 mIoU,两项指标均超过现有自监督基线的两倍以上,展示了无训练范式的强大潜力。 为了验证跨环境泛化能力,论文构建了 ReplicaOcc 基准,基于 Replica 场景提供较细粒度的语义类别。在零样本跨数据集迁移设定下,监督方法 EmbodiedOcc 的语义 mIoU 几乎降为零,自监督方法也几乎无法生成有效占据结果。FreeOcc 则表现出极强适应性:单目版本在 ReplicaOcc 上达到 46.81 IoU / 16.93 mIoU,RGB-D 版本达到 55.65 IoU / 20.90 mIoU,证明它没有对特定数据集的相机参数、尺度分布和标签体系产生过拟合。 在几何一致性方面,FreeOcc 也优于多个现有 3DGS-SLAM 系统。将不同方法生成的高斯地图转换为占据体后,FreeOcc 在单目设置下的平均 IoU 达到 39.34,优于 Photo-SLAM、MonoGS、DROID-Splat 等;RGB-D 设置下平均 IoU 达到 45.24,优于 SplaTAM、GS-ICP、RTG-SLAM 等。消融实验进一步显示,几何锚定高斯更新和几何感知初始化都至关重要:移除两者后,系统 IoU/mIoU 降至 27.98/11.20,帧率仅 8.8 FPS;加入 GAGU 后精度显著提升,帧率升至 25.0 FPS;再加入 G-ini 后,完整系统达到 45.03 IoU / 18.37 mIoU,帧率维持在 24.6 FPS。 FreeOcc 还具备真正的开放词汇查询能力。在 ReplicaOcc 场景中,用户只需输入“篮子”“时钟”“室内绿植”“挂画”等自然语言类别,系统便能在三维占据地图中准确锁定目标区域。这些目标通常尺寸小、语义粒度细,传统封闭类别方法难以覆盖。在定量评测中,FreeOcc 在开放词汇 top-10 类别上取得 31.06 mIoU,扩展到 top-20、top-30、top-40 类别时仍分别保持 23.02、16.57 和 12.01 mIoU,说明其语义理解能力具有良好可扩展性。 在实际部署方面,FreeOcc 已可直接应用于真实传感器数据流。研究团队使用 Intel RealSense D435i 深度相机在 Intel i9-14900KF + RTX 5090 平台上运行完整系统,无需预录轨迹、真实位姿或封闭类别标签,即可在室内外场景中持续构建三维高斯地图,并将开放词汇语义稳定投影至占据空间。结合 Qwen3-VL 多模态大模型自动生成可见物体类别,系统能根据“红色杯子”“黄色杯子”“蓝色杯子”等查询准确区分外观相似的目标,展示了细粒度的真实场景理解能力。 在线增量建图过程中,随着机器人持续观测,点云地图、三维高斯地图、语义地图和占据地图层层补全,最终形成完整且全局一致的三维空间表达。FreeOcc 开创了一条不同于传统端到端学习的新路线,让机器人在进入全新环境时无需重新训练,即可依靠自身传感器实时构建开放词汇占据地图。这一成果为机器人从“被动感知”走向“主动理解”奠定了重要基础,也为空间推理、导航避障、人机交互等下游任务提供了可迁移的场景表示。 该项工作由香港科技大学(广州)陈昶昊教授团队与 MBZUAI 研究者合作完成。论文第一作者包括博士生江泽宇、周常青,MBZUAI 助理教授左星星参与指导,通讯作者为陈昶昊教授。目前,论文全文、项目主页、代码和 ReplicaOcc 数据集均已公开,供学术界和工业界进一步研究使用。

Related

相關文章

IT之家AI Agent

Hugging Face CEO 德朗格:AI 企業應主動披露安全入侵事件

Hugging Face 執行長德朗格認為,限制企業發布前沿 AI 模型無法阻止類似 OpenAI 智能體逃逸事件,呼籲應讓更多人存取模型以提升防護能力。他主張強制實施智能體網路攻擊披露制度,主動公開入侵事件,以便分析問題根源並防範再發生。

剛剛
IT之家AI Agent

IBM:1/4 惡意數據洩露事件為 AI 攻擊導致,損失較均值高出 20%

IBM與Ponemon研究所調查顯示,AI驅動攻擊已佔惡意數據洩露事件的四分之一,比例年增56%,平均每起損失600萬美元,較整體均值高出20%。其中62%的AI攻擊鎖定關鍵基礎設施,金融與能源機構受創最重。調查也指出,應用AI與自動化防禦平均可為企業節省近200萬美元,但仍有四分之一企業未採用。

剛剛
量子位AI Agent

AI不再用完即忘:華為諾亞開源MindMemOS,記憶和Skill一起進化

華為諾亞方舟實驗室開源MindMemOS,這是一個面向AI Agent的可遷移、自演進記憶操作層,將記憶從單一Agent中解耦,並以實體、屬性、時間三維結構保存最新狀態與演化軌跡。系統透過Dreaming離線鞏固記憶、Feedback挖掘用戶糾正性反饋,並支援Skill版本演進,在LoCoMo、PersonaMem等基準上取得領先成績,同時提升SpreadsheetBench任務成功率。

1 小時前