國內第一視角數據最早押注者,北大盧宗青:隱空間才是具身的路
在2025年6月的智源大会上,北京大学助理教授卢宗青给出了一个在当时看来颇为“另类”的判断:人类视频,尤其是第一视角的人类视频,才是具身智能领域唯一能够持续规模化的数据路径。这一观点与彼时行业主流关注点形成了鲜明反差——当几乎所有团队都在打磨机器人本体、搭建仿真素材场、甚至豪掷千金建设数据飞轮时,卢宗青的话犹如一颗投入湖面的石子,涟漪虽未立即扩散,却已让部分从业者开始重新审视具身智能的底层逻辑。作为国内最早押注第一视角人类视频数据的研究者之一,卢宗青并不是在大会上随意抛出观点。据公开报道,他长期关注具身智能的数据来源与学习范式,并坚信真正的技术突破口不在模型架构的细枝末节,而在数据选择的源头。
在智源大会上,他明确表示:“人类视频是具身智能唯一可以 scale up 的数据路径。”这句话背后,是对现有技术路线的一次冷静清算。回顾2025年年中的具身智能行业,热潮之下不乏隐忧。机器人本体硬件的迭代速度令人振奋,但高质量的交互数据却始终稀缺。许多实验室依赖昂贵的遥操作设备,让操作员穿戴动捕服、操控机械臂,逐一采集抓取、放置、装配等动作数据;另一些团队则转向仿真环境,试图通过物理引擎生成海量合成数据。然而,前者受限于人力成本与场景覆盖,后者则常常面临“仿真到现实”的鸿沟。数据飞轮的概念被反复提及,但真正转起来的却寥寥无几。卢宗青的切入点,正在于打破这种“以机器人为中心”的数据获取惯性。
他认为,第一视角的人类视频天然包含“感知—决策—动作”的完整闭环:佩戴或固定在第一视角的摄像头记录下人的眼睛所看、头部所转、手部动作以及随之而来的环境变化。这种信号与机器人执行任务时所需的输入-输出格式高度契合。更重要的是,人类日常活动的视频数据在互联网、可穿戴设备以及影视素材中存量巨大,且仍在持续产生,几乎无需专门采集。“与其依赖昂贵的机器人采集或人工设计的仿真环境,不如直接从人类日常活动中获取海量交互信号。”这是卢宗青对数据来源问题的直接回答。在他看来,人类每天都在进行数以亿计的物理交互——倒水、拧瓶盖、整理桌面、操作工具,而第一视角视频恰恰忠实地记录了这些交互的全过程。
如果能够将这些数据有效利用,具身智能模型便能在近乎真实且极度多样的场景中学习行为规律,从而摆脱对人工采集规模的依赖。但仅仅强调数据规模,还不足以解释卢宗青观点的深层价值。他提出了一句更具哲学意味的论断:“隐空间才是具身的路”。这句话直指当前技术路线中关于“如何建模世界”的分歧。主流尝试中,一种是显式物理建模,试图让机器人理解重力、摩擦、碰撞等物理规律;另一种则是世界模型,希望通过预测未来帧或状态来构建对环境的理解。然而卢宗青认为,这些路径可能并未触及本质——真正的答案在于隐空间,即不直接建模物理世界的全部细节,而是在隐空间里学习紧凑的表征与决策策略。
所谓隐空间,可以理解为一种经过压缩的、抽象的表征空间。模型不再需要显式地推算“这个杯子会如何倾斜”,而是从高维视频数据中直接提炼出可泛化的行为模式。以第一视角视频为例,模型看到的是连续的像素流,但经过隐空间编码后,它可能学习到“接近物体→调整抓取姿态→施加力→观察反馈”这一连串潜在状态转换。这种学习方式更接近人类在经验中形成直觉,而非依靠精确的物理方程。卢宗青对世界模型的怀疑,也因此具有了清晰的立足点。世界模型试图让智能体在内部模拟未来,但其预测往往被环境的随机性和开放性所压制,尤其在长时程任务中,误差会迅速累积。
而隐空间学习则不同,它并不追求对全局状态的精确预测,而是专注于与决策相关的关键表征,从而更好地适应复杂、动态的真实世界。卢宗青直言:“世界模型可能也不是最终答案。”这无异于给那些将世界模型奉为圭臬的研究者泼了一杯冷水。更深一层来看,卢宗青的判断带有鲜明的逆主流色彩。当行业普遍忙于搭建数据飞轮、收集机器人本体数据时,他提醒人们注意数据的“质”与“源”——不是所有数据都值得等权重地投入模型训练,第一视角人类视频所蕴含的交互意图和因果结构,是普通第三方视角视频或机械重复的机器人动作数据所无法比拟的。
这种对数据本质的敏感,源于他对具身智能核心问题的长期思考:一个能在家居、医疗、工业等多种场景中泛化的智能体,究竟需要什么样的经验?卢宗青将讨论拉回了一个更朴素的起点:先解决数据从哪里来、如何 scale up 的问题,再谈模型架构的终局。在他看来,具身智能的确定性技术尚未出现,现在谈“终局”为时过早。数据源的突破,才是驱动算法与模型进化的真正动力。如果人类视频数据能够被充分挖掘,那么具身智能的训练将不再受限于实验室的机械臂和仿真引擎,而是可以借用整个人类活动史作为学习素材。这一判断也引发了行业内外的反思。
在智源大会之后,一些投资人和研究者开始尝试调研第一视角数据集的潜力,各类可穿戴摄像头、智能眼镜的布局也被重新审视。不过,也有质疑者指出,第一视角视频虽然规模巨大,但其标注成本高、隐私问题复杂,且需要解决视角迁移到机器人执行器的转化难题。卢宗青对此并未回避,他认为,这些挑战属于工程问题,而数据源的方向性选择才是更根本的战略问题。事实上,卢宗青的早期押注并非毫无根基。早在行业热议具身智能之初,他便带领团队着手收集和整理第一视角人类视频,并探索其在机器人操作学习中的应用潜力。这种研究路径在当时显得冷门,甚至被认为“偏离主流”,但正是这种长期主义的坚持,让他在智源大会上能够自信地提出与主流相悖的论断。
他所强调的“隐空间才是具身的路”,也不只是抽象的概念,而是要落成一整套从数据采集、表征学习到策略优化的方法论。如今,回看卢宗青在2025年6月的演讲,其价值或许不在于给出了终极答案,而在于为被热潮裹挟的行业提供了一次冷静的校准。当所有人都在追逐“更好看的机器人”和“更复杂的仿真器”时,他提醒大家:具身智能的智能,最终要从真实的人类经验中来。数据是第一位,架构是第二位;没有强大的数据源,再精巧的模型也只是空中楼阁。这并不意味着卢宗青的路线一定正确——第一视角人类视频能否真正支撑起通用具身智能,尚需时间与实践检验。但至少,他已经走出了一条值得关注的方向。
在技术尘埃落定之前,敢于在数据源头下注的人,或许正在为未来的具身智能铺设看不见的轨道。而卢宗青所说的“隐空间”,也许正是那条轨道通向的下一站。
Related
相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界
世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤
作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。
數學自動形式化迎來重大突破:OpenBMB開源MathForm,8B模型憑實力逆襲大廠
OpenBMB團隊開源數學自動形式化框架、數據集與模型MathForm,目標是用Lean4讓機器準確讀懂並形式化驗證數學定理,攻克通用人工智能核心挑戰。其關鍵不是簡單翻譯自然語言,而是將每個數學概念精準映射到Mathlib庫中,為數學與AI交叉研究提供新工具。

加州伯克利數學教授撰文批評學生基礎差,卻被抓包“用 AI 寫的”
作者:清源 責編:清源 評論: 8 月 23 日消息,據英國《衛報》20 日報道,加州大學伯克利分校數學教授茲韋茲德利娜 · 斯坦科娃日前在《舊金山標準報》撰文批評部分學生存在“嚴重”的數學基礎缺失,卻又承認文章本身曾藉助 AI 編輯,由此引發爭議。

美國專家示警:學生依賴“AI 代寫”會削弱思考能力
作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。