對話郎鹹朋:具身也會有“蔚小理”,靠融資實現不了物理AGI

理想汽車前智駕一號位,8年把輔助駕駛從0做到150萬輛量產,交付端到端和VLA; 今年3月創立了具身智能公司崑崙行——90天內連融三輪,規模達數十億元,跑成一家獨角獸。這是他出來創業後的首次公開露面。近2小時聊下來,有幾條信息足夠勁爆: 具身智能有多燒錢?訓一個具身大模型,幾億、十億都打不住,得幾十億甚至上百億。只靠融資,誰都撐不到具身實現的那一天。眼下這場“百機大戰”,在他看來會像新能源車一樣大浪淘沙,最後跑出具身智能自己的“蔚小理”。
至於整個行業走到哪一步,他的參照系是十年前的自動駕駛—— 2015、2016年那陣,路線不定、demo滿天飛,但沒一家真出貨…… 90天,跑出一傢俱身獨角獸 郎鹹朋是理想前智駕一號位,用8年把理想的輔助駕駛從零做到150萬輛車規模的量產。他的搭檔任庚曾任華為國家CEO、阿里巴巴集團副總裁、阿里雲中國區總裁,現在是崑崙行的創始人兼CEO。兩人在各自不同領域取得成功後,如何雙向選擇,攜手同行?一直是外界的疑問。△崑崙行創始人兼CEO任庚 關於這一點,郎鹹朋與任庚有著高度一致的共識: 行不行、合不合、久不久。
行不行看能力,這個最好驗證,從過往做過的產品和成績裡就能看出來,而且兩人的能力要互補,他管技術和研發,任庚管商業和管理。合不合看認知,兩人圍繞具身智能的產品、技術、商業聊了很多,發現判斷驚人地一致。久不久看這件事值不值得長期投入,他們認定具身不是三五年的短期生意,是一件能做十年的事。三條都過關,剩下的就快了。兩人很快就達成一致,然後一起出來做了崑崙行。在他看來,選合夥人還有一條更要緊的標準。“合適比熟悉更重要。” 郎鹹朋說,創業選的是能把事做成的人,不是相處起來舒服的人,最好兩樣都佔,但前者更關鍵。至於公司為什麼叫崑崙行,郎鹹朋說這名字有講究,值得好好說說。
一開始他們想過不少很fancy、很科幻的名字,但最後還是落回了崑崙行。“崑崙”是中華民族的圖騰,一說出來大家就知道,這是一家有很強的民族使命感的中國公司;“行”代表使命必達,一定能行。兩個字合起來,是中華民族在具身智能上一定行。名字背後是一個更大的判斷。在郎鹹朋眼裡,崑崙行是站在時代的趨勢上做這件事,他希望在探索物理AGI的這段歷史裡,能留下公司每一個人的名字。創業之前,想清楚的三件事 註冊公司之前,有些事必須先想清楚,有些可以邊做邊改。崑崙行想清楚的是三件:範式、方法、路徑。先說範式。郎鹹朋把範式選對,稱作具身智能的第一性原理。做自動駕駛時,如果一上來用規則去做,就不會有後來理想汽車的成功。
做具身也一樣。他的判斷是,不能沿用自動駕駛那套範式,因為無論端到端還是VLA,底子都還是模仿學習。△崑崙行聯合創始人兼CTO郎鹹朋 機器人的範式應該是理解,不是模仿。一個場景可以靠模仿,上萬個場景沒法靠模仿。範式怎麼落成能操作的方法,是第二件事。郎鹹朋的答案還是數據,他將數據效率概括為一個公式: 數據效率=獲取效率×使用效率。過去自動駕駛和大模型的成功,佔的是獲取效率的便宜,互聯網數據、人類開車的數據,幾乎零成本就能拿到。具身不行,你不可能先把機器人搬進用戶家裡、讓人手動操作兩年再來訓練。
獲取這條路不好走通,崑崙行押的是使用效率,做法就是他們提到的數據編譯,讓機器人學會理解物理世界所需要的信息和知識。光有數據和模型還不夠,得有工程兜底。這一點郎鹹朋拿Anthropic這家公司打了個比方,大家覺得Claude Code好用,模型強是一方面,但支撐它真正好用的,是背後那套Agent機制。崑崙行做機器人的工程落地,用的也是Agent的工程框架,而不是過去軟件硬件簡單拼湊的做法。第三件是商業路徑。崑崙行的選擇是先toB再toC,從工廠上下料、物流這些相對簡單可控又有商業價值的場景入手,家庭放到最後落地。家庭是終點,不是起點。原因是家庭太複雜,而且對安全性、可靠性的要求極高。
家裡有老人有小孩,技術不成熟就進去,不只對這一個家庭有風險,對整個行業也會造成傷害,這是郎鹹朋做自動駕駛多年留下的職業警覺。範式、方法、路徑想清楚後,剩下的細節,比如模型怎麼設計、數據管線怎麼搭,郎鹹朋認為可以邊做邊迭代。他把這條經驗總結成一句話,“出發永遠比想清楚更關鍵。” 把“理解”寫進模型和數據裡 範式選了理解,落到技術上是兩件具體的事,模型怎麼設計,數據怎麼做。先看模型,崑崙行的世界模型從第一天起,就錨定了一個叫「物理因果」的第一性原理。郎鹹朋的類比是人,人做事先有目的,為目的產生動作,動作產生結果,結果再回過頭評價動作的好壞,他們的模型就照這個順序設計。
崑崙行現在這套模型的架構是MoT,是一種由多個專家網絡分工的結構。MoT本身不算新,很多團隊都在用,崑崙行的不同點在於分法。別人大多按模態分,文本一個專家、視頻一個專家、動作一個專家;崑崙行按目的、動作、結果來分,分的是一張因果圖。跟它配套的,是一個自研的「聯合因果注意力機制」。過去MoT裡幾個專家的注意力是完全共享的,郎鹹朋認為不合理。做動作的時候,模型只應該看到目的;動作做完,負責結果的專家才能看到動作和目的產生了什麼。所以他們讓注意力單向流動。用他的話說,做動作時不能偷看結果,“這樣就作弊了”,也不符合因果。
崑崙行希望藉此避免模型通過結果反推動作,讓模型學習到的關係更符合真實物理世界中的因果順序。按照郎鹹朋的描述,這套世界模型還試圖用同一套架構、參數和權重,同時完成多種任務:既可以生成動作,也可以預測動作結果,還可以渲染最終的視頻。不過,郎鹹朋並沒有將當前方案,描述為一個已經收斂的終局架構。在他的判斷中,具身智能還處於非常早期的階段,具體模型和方案必然會繼續調整。正如自動駕駛曾經歷有圖、輕圖、無圖、端到端和VLA等多次範式切換,世界模型也可能只是當前階段通往物理智能的一種實現方式。模型之外是數據。崑崙行的另一項核心工作——數據編譯,具體分為四步。
第一步,把場景裡每個物體的物理量顯式標出來,重力、重量、受力、摩擦。這些不一定靠觸覺傳感器去測,很多是模型自己算出來的。第二步,沉澱物理機制,比如牛頓第二定律這類規律。第三步,把物理量和機制編譯進訓練樣本,讓樣本自帶物理。第四步,用數據回傳的機制不斷迭代,把表現不好的數據挖出來重新標註和編譯。編譯過的數據富含物理因果,訓出來的就不是一個只會找相關性的模仿模型。這套做法還帶來一個郎鹹朋很看重的性質,「一腦多形」,一個大腦驅動多種形態的機器人。他說這不是刻意設計,是天生如此。模型學的是物理規律,而物理規律對任何形態都成立,天然就一腦多形;反過來,如果學的是分佈、是模仿人的動作,那就只能一腦一形。
別把具身智能看窄了 在展臺上,現在的機器人幾乎都在幹活,比如拿藥、分揀、上下料等等。但在郎鹹朋看來,把具身智能等同於“會幹活”,太窄了。他把具身拆成四個智能: 運控、移動、交互、操作。運控智能是唱歌跳舞那類表演,在表演型機器人上已經做得不錯,但工作級全身運控遠未成熟。移動智能跟自動駕駛最近,把自動駕駛的技術挪到導覽、巡檢機器人上就是,只是不帶操作。交互智能是跟人對話,得益於大語言模型,這兩年也相對成熟了。真正難、真正還處在早期階段的,是操作智能,讓機器人實際進場景、取代人幹活。現在大家演示的都是關於它的應用場景,於是很多人默認「能幹活才叫真具身」。
郎鹹朋認為除了操作智能以外,前面三種智能也在迭代,也很重要,“大家不要只盯著操作智能”。這套四分法,直接決定了硬件怎麼選。最省事的做法其實是大量鋪輪式機器人,先把原型做起來。郎鹹朋認可這是大家自然會想到的路子。輪式相當於把移動和運動控制這塊砍掉了,只留上半身操作加一個基礎的移動能力,不符合四個智能全面發展的前提。所以崑崙行一開始就堅定做全尺寸、全人形,自研關節驅動電機、本體和關鍵結構。他不否認輪式上手更快,但從技術角度,人形才是最優質的選擇,雙足運控加全身的操作、移動、交互,這些技術基礎第一天起就得打好。順著操作往下,自然繞不開靈巧手。業內一直有視覺派和觸覺派之爭,郎鹹朋把票投給了觸覺。
他的理由是人。人做一個動作,最終不是靠眼睛檢驗的,是靠手感。拿杯子的時候,眼睛看著別處也能拿到,杯子拿得穩不穩,全靠觸覺。所以觸覺是相當重要的一個模態,未來會作為他們數據編譯的真值,反過來校準編譯出來的數據。而且觸覺本身就是物理的,正好接上崑崙行物理因果這條線。△圖片為AI生成 至於靈巧手要不要自研,郎鹹朋說內部還在討論中。他的順序是先想清楚要什麼模型、什麼數據,再反過來定義手。因為手會帶來大量自由度,一隻二十個,兩隻就多四十個,太早動手只會給訓練增添不確定性。光靠融資活不下去 那,具身智能現在整體走到哪一站了?郎鹹朋的判斷是,有點像十年前的自動駕駛,2015、2016年那個階段。
特徵有三個,技術路線不確定、百家爭鳴;大家都在做各種demo,有些做得像明天就能上路一樣;但沒有一家真正開始出貨。有人會立刻站出來反駁,已經有XX公司賣出幾千臺了。郎鹹朋說,他指的是操作智能,就像當年演示的自動駕駛Demo清一色展示的是L4功能。在他這裡,真正的操作智能有個很直接的門檻,能不能進工廠、進商場、進家庭,取代人真幹活,有沒有人願意為它買單,而不是停在前期的研究和測試階段。回顧自動駕駛的2015、2016年那會兒,買一輛林肯MKZ改裝出來,就能拿到一筆不小的融資;到後來才是正向造車、造車隊、真量產,而且那時候用戶是真為了自動駕駛功能買單。具身到現在,還處在前半段。
既然大家都還沒走到出貨那一步,這場被叫作“百機大戰”的混戰,何時會見分曉?郎鹹朋的答案只有一條,量產交付能不能自我造血,靠自己的營收養活研發,而不是靠融資續命。任庚曾對外放過一句話: 崑崙行在最短時間內進入行業前三。為什麼非得是前三?郎鹹朋的說法是,到了前三才有自我造血能力。就像新能源車一樣,剛開始熱鬧歸熱鬧,大浪淘沙之後,頭部剩不了幾家,具身智能也會湧現它的“蔚小理”…… 那到底要燒多少錢。郎鹹朋說,以現在各家的融資額,都不夠。真要做出操作智能,一定要做模型預訓練和大量訓練,而訓一個模型,幾億元、十億元的量級都不夠,可能得是幾十億甚至上百億。
所以前提一定是先自我造血,拿自我造血掙來的錢去養後面的模型迭代,而不是隻靠融資。只靠融資,誰都撐不到具身實現的那一天。關於崑崙行,郎鹹朋說現在的融資額,已經足夠讓公司第一款產品量產上市;上市之後,公司就進入一個健康的正向造血狀態。往後再融的錢,一是加快AI迭代,二是加大量產和營銷的投入。至於外界最關心的機器人進家庭是哪一年,郎鹹朋給的是參考自動駕駛的節奏,大概五到十年。但他也補充,AI現在進步的速度太快,會把這一天不斷往前拽,五年左右會比較合理。One More Thing 對話中,郎鹹朋提到一個細節:他讀博時待的,是機器人領域的一個國家重點實驗室。
後來兜兜轉轉做了十幾年自動駕駛,如今又繞回了機器人。“我感覺有一種宿命在裡面。”他說。從百度到理想,再到崑崙行,中間那條線一直沒變過,強調數據、工程化和真實落地,方向比具體的“術”更關鍵。他用一句話來形容: “有道無術,術尚可求之;有術無道,止於術。” 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界
世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤
作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。
數學自動形式化迎來重大突破:OpenBMB開源MathForm,8B模型憑實力逆襲大廠
OpenBMB團隊開源數學自動形式化框架、數據集與模型MathForm,目標是用Lean4讓機器準確讀懂並形式化驗證數學定理,攻克通用人工智能核心挑戰。其關鍵不是簡單翻譯自然語言,而是將每個數學概念精準映射到Mathlib庫中,為數學與AI交叉研究提供新工具。

加州伯克利數學教授撰文批評學生基礎差,卻被抓包“用 AI 寫的”
作者:清源 責編:清源 評論: 8 月 23 日消息,據英國《衛報》20 日報道,加州大學伯克利分校數學教授茲韋茲德利娜 · 斯坦科娃日前在《舊金山標準報》撰文批評部分學生存在“嚴重”的數學基礎缺失,卻又承認文章本身曾藉助 AI 編輯,由此引發爭議。

美國專家示警:學生依賴“AI 代寫”會削弱思考能力
作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。