不做硅谷follower:幾個讀博的年輕人,押注雙足人形的一體化大腦

2026年8月23日 17:32
不做硅谷follower:幾個讀博的年輕人,押注雙足人形的一體化大腦
站內 AI 整理稿

一個機器人駕駛卡丁車在賽道上飛馳,過彎、加速、打方向,一鏡到底。沒想到我們的機器人現在已經可以在卡丁車賽道炫技了呢!等等?這和我在WRC看到的畫風不一樣啊!展會上的機器人跑步、還有火花加閃電,沒想到視頻裡的機器人什麼時候揹著人類偷偷報名賽車培訓班了?它完全是個老司機,高速過彎、靈活避障,跑一圈下來一氣呵成。和以往那些機器人慢吞吞走過去、彎腰拿東西的demo相比,這段視頻裡的機器人真的自己坐進了車裡,手眼腳同步協同,在全速狀態下完成多接觸點平衡和精細力控。我把視頻放上來大家品品。

這種人形雙足機器人能夠眼、手、足,全身協同,在高速運動、複雜姿態的變化下的全身協調完成細節操作,在此前的人形機器人演示裡幾乎沒出現過。放出這段視頻的,是一家叫共生知行的公司。共生知行做的,是雙足人形機器人的端到端感控一體化「大腦」,也就是基座模型。創始人丁鵬翔96年出生,核心團隊其餘成員全是00後,全員博士在讀,公司成立剛滿兩個月。對於這個看上去有點「不務正業」的Demo,丁鵬翔這樣解釋: 我希望機器人能更像人,而不是隻去做一些很機械的服務功能。好比人能開卡丁車,機器人也能幹。一個問題隨之而來:為什麼一群連畢業證都還沒拿到的年輕人,敢去碰具身智能裡最難、最前沿的那條賽道?

押最難的路:研究過分層,現在要挑戰端到端 「端到端」雙足人形機器人模型這個賽道新到什麼程度?新到市面上找不到現成的人才。按丁鵬翔的說法,這個方向近兩年才熱起來,懂技術的人還在讀博士,他們幾乎沒辦法從人才庫裡找到符合需求的人。已畢業多年的跟不上節奏,沒讀到博士的,對底層的理解又差一口氣。最前沿的突破,就握在這一批頂尖博士生手裡。共生知行的團隊就是這樣一批年輕又前沿的人。他們斬獲了國內具身智能領域最具分量的學術榮譽——兩項 Best Paper,並有一項入選 Best Paper Candidate;也打造了國內首個 GitHub Stars 突破 2K 的具身基座模型。

更重要的是,他們並非風口到來後的追隨者,而是國內最早一批探索具身基座模型的先行者,也是這個賽道最堅定的長期主義者。團隊累計發表40餘篇頂會論文,技術版圖覆蓋感知、決策、控制、數據與系統全棧;從雙系統、輕量化到多構型,一系列行業首創工作,都出自這支年輕團隊。他們的判斷很明確:機器人最終最廣泛進入人類生活的形態是雙足; 按照自動駕駛和大模型的進化路徑,端到端是效率最高的技術模式。這個判斷源自他們的一線研究經驗。早在2023年12月,丁鵬翔就開始給四足機器人裝「大腦」 。

他以一作身份發佈QUAR-VLA,是首個面向四足機器人的VLA任務範式,讓上層模型(大腦)負責理解視覺、 語言和任務意圖,再把決策交給底層運動系統(小腦)執行。這套「大腦管理解決策、小腦管運動執行」的分層思路,就是行業裡說的分層,今天 Figure這樣的公司都在沿用方案。在隨後的研究中,他逐漸發現了問題。他把分層描述為「理論上可行、但是不那麼優雅的方案」: 大腦和小腦各做各的,每接一個新任務,都要對上游輸出做定製化微調,才能把效果調好。更深一層,是結構上的先天缺陷。大腦和小腦分開訓練,部署時再拼起來,每個局部更好,也不能保證整體最優; 兩層之間每翻譯一次,就增加一次級聯誤差和信息損失。

丁鵬翔判斷,「只要分層,中間就有信息瓶頸,這種接口設計決定了分層架構無法實現真正意義上的Scaling。」 這一判斷也來自他對自動駕駛和大模型發展的長期觀察。早期自動駕駛依賴感知、預測、規劃、控制多個模塊協同,後來開始探索讓模型直接從數據中學習駕駛能力。特斯拉FSD轉向端到端後,性能大幅提升。在丁鵬翔看來,機器人可能也會經歷類似變化,讓模型從數據中學習完整的「感知—理解—行動」過程。他的邏輯是,從2023年開始已經把分層路線反覆做過,如果判斷未來的數據規模化最終會把系統推向端到端,就沒有必要再繞一次彎。這一步在2026年正在發生。

谷歌的Gemini Robotics 2已經用單一策略把從腳到指尖的全身動作統一進一個模型; RSS 2026的頂會共識卻寫明,端到端單模型無法覆蓋全身複雜動態,分層模塊化是現階段最優落地方案。共生知行押的純端到端,是一條更激進、更少人走的路。為什麼偏偏是雙足?丁鵬翔的答案是第一性原理:人類社會的建築、工具、環境,全是照著人的身體構型造的。輪式只能固定在產線和商場裡幹活,雙足能出門、上下樓、開車,還能跨場景完成不同任務。通用性意味著成本攤薄,雙足還有擬人化的親和感。時機同樣關鍵。2026年4月之前,雙足人形連通用遙操作模型都沒有,沒有數據來源就訓不出基座。

直到英偉達Sonic開源,行業才有了大規模生產數據的基石。這個方向已經不再處於「想訓也沒有數據」的早期階段,又還沒有成熟到路線完全收斂,共生知行賭的就是中間這個窗口。技術分水嶺:別人在學運動學,他們在啃動力學 先弄清一個分水嶺:現在絕大多數機器人基座模型,學的其實是運動學。運動學關心從A點到B點,手移動到哪裡、抓沒抓住,固定基座機械臂這麼幹沒問題,因為它不會倒。雙足機器人伸手去夠一個東西,身體重心會同時發生變化; 下蹲拿物體時,腰部要前傾,踝關節和腿部要重新分配力度、保持平衡; 再疊加摩擦、碰撞、慣性和接觸,模型面對的已經是一套全身動力學。

據丁鵬翔介紹,一臺g1雙足人形有29個自由度,比機械臂的7個自由度複雜得多。過去機器人學的是「動作軌跡」,人形機器人要學「身體如何在物理世界中行動」。從運動學到動力學,從完成任務到保持穩定,這是雙足機器人模型真正的技術分水嶺。這能解釋共生知行為什麼把模型一路做到Joint Target,也就是關節目標層。分層方案裡,大腦先輸出運動學目標,下游小腦再解算成關節動作; 共生知行把這個中間環節拿掉,讓模型直接面對幾十個關節的身體狀態。問題隨之而來:把小腦拿掉,機器人還站得穩嗎?光靠模仿學習,模型只學會標準動作,沒見過執行中各種踉蹌的身體狀態,遇到陌生狀態就可能直接摔倒。它缺的是從失敗裡站穩的能力。

共生知行的核心,是一套「任務行為建模—運動先驗蒸餾」的雙域協同優化機制。一條優化通路延續行為克隆,保證任務精度與動作擬合能力;另一條通過DriftDistill,將底層控制器積累的穩定性、抗擾動與Failure Recovery能力,轉化為統一模型的內生運動先驗。它並非簡單疊加兩個Loss,而是將「準確完成任務」與「穩定控制身體」兩類能力融入同一模型,讓大模型同時獲得任務智能與身體智能。如果DriftDistill能隨模型和數據量繼續擴展,它試圖解決的就是一個更大的問題: 在認知Scaling之外,機器人能不能連運動控制能力也一起Scaling。

丁鵬翔將這一運動能力匯聚模塊稱為Motion Expert(運動專家模型),目前規模接近1B,並通過蒸餾不斷吸收不同運控模型的能力。再往前一步,端到端大模型還要解決機器人輸出的力。今天很多機器人系統主要控制位置,但機器人真正進入現實世界後,位置正確並不等於任務完成。手伸到抽屜把手上,卻不知道該用多大力,門依然打不開;給人遞東西時位置沒問題,力量過大同樣不安全。共生知行的技術路線是先把Force Expert作為安全接觸專家,讓它學習施力、柔順、阻抗和接觸反饋,再通過策略蒸餾逐步融入Motion Expert和最終的端到端模型。位置決定機器人能不能「到那裡」,力決定它能不能真正「把事情做好」。

這也是共生「全身物理世界模型」的含義:讓模型理解身體怎樣受力、失衡、接觸,再把這些約束直接變成動作。數據、湧現,和一張冷靜的時間表 模型真正訓練起來,首先撞上的就是數據荒。全球合規機器人數據截至2026年初大約50萬小時,不足大語言模型的兩萬分之一。尷尬的是,很多數據採的是站定操作,機器人在格子間裡原地幹活,對全身移動操作幫助有限。共生知行的Blog放出了約1萬多小時數據,自採其中幾千小時。全身協調模型真正稀缺的是真實生活裡的強耦合全身移動操作數據,比如騎單車、開卡丁車、給籃球打氣等。

他們的解法是TrajBooster:從機械臂或輪式機器人身上提取末端軌跡,讓人形機器人在仿真裡追蹤這條軌跡並保持平衡,把不同來源的動作統一到同一個空間裡,複用機械臂已經定義好的任務多樣性,低成本給預訓練提供數據。談到模型能力,丁鵬翔幾乎不用「泛化」這個詞。用他的話說,「這個詞沒什麼營養,像說一個人好一樣空。」 他要的是「湧現」:在關節角層面,比如給模型訓練的是走和跳的數據,它在測試的時候自己組合出跑這個新的技能。因為只有到關節層面,部分動作能力才可能組合出全新動作。時間表上,他的判斷很冷靜。他推斷,十萬小時左右數據更多還是實驗室級Demo,真正有大規模商業意義,可能要等到百萬小時之後。

現在行業甚至連最合適的數據形式都沒有收斂,肌電、外骨骼、動捕、Pico遙操等路線仍在競爭。在他看來,人形機器人當前最難的三個問題,第一是感知和控制究竟應該怎樣Combine,第二是應該用什麼類型的數據,第三才是數據規模本身。丁鵬翔希望,有一天由中國團隊設計出來的機器人模型架構,也能反過來被北美同行廣泛採用。我們不希望當Follower,我們希望去引領技術的發展。回到那輛卡丁車。讓它全速過彎的,是一群還沒畢業的年輕人。他們押的,是具身智能裡最難、最前沿的方向。賭的是端到端終將取代分層。行業還遠沒有到可以證明終局路線已經跑通的時候,甚至丁鵬翔自己也承認,整個雙足基礎模型行業都還沒有真正收斂。

但一支創業團隊的前沿性,有時候恰恰不在於把一個成熟答案做得更快,而在於它能不能比同行更早看見下一道真正重要的問題,並且敢在答案還不明朗時動手去解。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界

世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

剛剛

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤

作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。

剛剛
何夕2077研究與前沿

棋類模型可解釋

在人工智慧研究領域,模型的可解釋性一直是備受關注的課題。近期有觀點指出,棋類模型具備可解釋的特性,這意味著此類模型的決策過程與內部運作機制,能夠被研究者或使用者以相對直觀的方式理解與分析。相較於許多深度學習模型常被視為「黑箱」,棋類模型在處理圍棋、象棋等棋類遊戲時,其每一步的選擇與策略推演,往往能透過棋譜或演算法邏輯加以回溯,從而為AI的透明化提供了一個具體的觀察窗口。

6 小時前

美國專家示警:學生依賴“AI 代寫”會削弱思考能力

作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。

10 小時前

全球首次!機器人迎戰網球運動員,極限救球,摔倒光速彈起

震撼的方式走進公眾視野。 這場被載入AI發展史的人機大戰,不僅證明了機器能夠在複雜博弈中挑戰人類頂尖水平,更成為人工智能邁向新階段的一個標誌性時刻。 十年之後,2026年,屬於具身智能的“AstraTennis時刻”已經到來。 8月22日,世界人形機器人運動會盛大開幕。開幕式現場,銀河通用機器人受邀參加機器人網球比賽,與網壇頂尖運動員同臺競技,並由中央廣播電視總檯面向全球直播。

13 小時前