人形之外,擎羽把“身體”變成具身智能的新變量

過去兩年,滾燙的金錢和聰明的大腦紛紛湧入人形機器人行業。這背後的邏輯足夠清晰:現實世界圍繞人體尺度建造,雙腿可以跨越臺階,雙臂可以覆蓋工作臺,雙手可以使用現成工具。一副與人相似的身體,理論上能夠直接進入工廠、倉庫、商店和家庭,複用人類已經建立的物理基礎設施。但人形所追求的通用性,也把機器人領域最困難的一組問題,壓進了同一套系統。比如動態平衡、高自由度控制、靈巧操作、碰撞安全、能量效率和開放環境泛化,需要在一副身體上同時成立。而當機器人真正走向產業,另一個問題正在浮現:通用機器人是否一定意味著通用身體?
李飛飛近期在圍繞空間智能和機器人訓練的討論中,也給出了一個接近工程現實的觀察: 人體由演化塑造成了適應開放、非結構化環境的通用形態,當任務邊界足夠明確時,最高效的身體可能沿著完全不同的方向演化。她用“爬樹”舉例,如果一種生物長期面對的核心任務只有爬樹,它最終形成的身體形態,大概率不會和人類相同。這恰好解釋了擎羽科技(FEAGINE)選擇的路線。擎羽由香港大學機器人學博士、前大疆創新嵌入式工程師彭銳創立,聚集了一批來自斯坦福、清華、普林斯頓、大疆等全球頂尖科技與研究體系的人才。這家公司沒有從複製一副人體開始,而是先把“身體”本身作為一個可以重新設計的變量。
在本次發佈中,擎羽帶來了FEAGINE A01、A02、A03三款仿生柔性機器人,以及第一代跨本體基礎模型Fi0:Foundation Intelligence Across Embodiments。前者解決的是機器人可以擁有怎樣的身體,後者研究的則是身體發生變化之後,已經獲得的智能能否繼續使用。單獨看,A01、A02、A03是三款長度、節段、自由度和負載能力不同的柔性機器人;把它們與Fi0放進同一張技術路線圖,它們又成為一組真實的embodiment variation。
身體逐漸變長,節段逐漸增加,可達空間、運動路徑和接觸方式隨之變化,而模型需要理解其中哪些東西屬於任務和世界,哪些東西由身體決定。擎羽把這條硬件、數據與模型共同演化的技術路線稱為:柔性具身智能。人形之外,具身智能的身體仍有巨大的設計空間 在機器人領域,柔性通常首先指向材料和機械結構。軟體機器人、連續體機器人和繩驅機器人通過彈性結構、連續彎曲或柔順驅動獲得更豐富的構型,使機器人能夠順應環境、包絡物體,並降低剛性碰撞帶來的風險。柔性具身智能將這個概念繼續向上推進。
柔性具身智能,是以可連續形變、可順應接觸的機器人本體為物理基礎,將身體的結構參數、實時形態、感知和驅動能力納入模型上下文,使任務知識與世界理解能夠跨越不同身體複用,並由模型為當前身體生成適配行動的一類具身智能系統。在擎羽的判斷中,柔性本體能夠拓展近人交互與複雜動作的邊界,連續構型也為數據映射和跨本體泛化提供了新的基礎。友善的本體、豐富的數據、泛化的模型,被擎羽視為機器人進入真實生活空間的三個核心要素。這條路線沒有否定人形機器人的長期價值。它提出的是另一種市場結構:未來的機器人可能擁有許多不同的身體,通用性由共享智能提供,而每一種身體圍繞自己的任務和環境達到更高效率。
全球首個量產繩驅柔性本體產品矩陣 FEAGINE A01、A02和A03,構成了全球首個實現標準化量產交付的繩驅柔性本體產品矩陣。三款產品沿節段數量、自由度、長度和負載能力逐級展開,對應不同的實際部署需求。FEAGINE A01採用一段柔性關節和2個自由度,整機重量750克,末端負載200克,更適合搭載在移動底盤、巡檢設備和其他對重量敏感的平臺上,在有限空間內完成輕量操作。A02擴展至兩段柔性關節和4個自由度,整臂長度30釐米,末端負載400克,最高移動速度達到0.78米每秒。更大的工作空間和連續彎曲能力,使它能夠進入桌面操作、近人服務、狹窄空間作業以及需要柔順接觸的場景。
A03進一步增加到三段柔性關節和6+1個自由度,整臂長度50釐米,末端負載600克,最高移動速度達到1.17米每秒。更多節段帶來了更大的構型空間,使機器人能夠繞過障礙、從複雜角度接近目標,並承擔更長距離、更高自由度的操作任務。三款產品均支持ROS 1、ROS 2、Python與C++,A02和A03還配套GUI、MuJoCo與SAPIEN環境。從移動操作、近人服務,到複雜空間中的抓取和交互,擎羽把柔性機械臂從實驗室裡的科研用具,變成可以直接集成和部署的標準機器人本體。對Fi0而言,這組產品還有另一層意義。隨著長度、節段和自由度變化,同一個任務會自然產生不同的運動路徑、身體構型和接觸方式。
短臂可以直接接近目標,擁有更多節段的長臂能夠利用構型冗餘繞開障礙,雙臂或多臂系統還可能重新組織任務中的動作分工。任務保持不變,身體開始系統地改變任務的實現方式。A01、A02和A03因此不只是三個SKU,它們也為Fi0提供了一組真實、連續且可以反覆驗證的本體差異。每增加一種長度、節段和組合,模型都獲得一個新的樣本,用來理解身體變化究竟如何改變行動。Fi0:跨本體基礎模型Foundation Intelligence Across Embodiments 從上下文學習機器人技能,理解物理世界,並讓行動適應不同身體。
Fi是擎羽對Foundation Intelligence的長期研究方向,Fi0是這一方向下的第一代跨本體基礎模型。它建立在一個基礎判斷上: 機器人對於任務和物理世界的理解,應當可以跨越身體繼續複用; 真正需要隨著身體變化的,是行動。當任務是“把方塊放進碗裡”,機器人從A01換成A03,或者從單臂變成雙臂,任務本身並沒有重新定義。操作對象之間的關係、抓取與釋放的接觸邏輯、任務推進的順序以及最終的成功狀態,仍然可以複用。隨著身體變化,真正需要重組的是可達空間、動作維度、運動路徑、身體構型和動力學結果。
Fi0希望讓任務意圖、物體關係、接觸邏輯和目標狀態在不同身體之間延續,再根據當前機器人的形態、感知、驅動能力和動態狀態,生成適合這副身體的動作。但跨越身體只是Fi0希望解決的一半問題。真實世界中的任務同樣不會在訓練階段被窮盡。對於模型已經掌握的技能,Fi0可以直接執行;遇到訓練覆蓋之外的任務時,人類可以通過擎羽的Ego頭環來提供一次demonstration。模型將這段示範作為推理時的skill context,從中理解操作對象、任務過程、關鍵接觸和目標狀態,再調用已經獲得的世界知識與操作能力完成執行,而無需針對當前任務重新訓練參數。
由此,Fi0的能力沿著兩個方向同時展開:新的技能可以通過上下文進入模型,已有技能可以跨越不同身體重新表達。語言、視覺、人類示範、世界狀態和本體信息共同構成Fi0的上下文。語言給出目標與語義條件,demonstration在需要時補充具體技能,視覺與世界表示持續描述環境正在發生什麼,本體信息則告訴模型此刻控制著怎樣的身體。任務可以來自預訓練獲得的能力,也可以在使用過程中通過上下文補充;真正執行時,模型再根據當前世界和當前身體生成行動。圍繞這條鏈路,Fi0同時建立對技能、世界、身體和行動後果的表示。
Skill Encoder將人類示範轉化為可調用的技能上下文; Cross-view World Encoder從不同觀察視角中學習共享的物理世界; Embodiment Graph將機器人結構與實時狀態納入模型; World Dynamics Model與MAWA則進一步預測並評估不同動作可能帶來的未來。這些機制最終服務於同一個目標:讓機器人能夠在使用過程中獲得新的技能,並在身體發生變化之後,繼續調用此前積累的任務知識和世界知識。從上下文中學習技能 機器人基礎模型正在覆蓋越來越多任務,但真實世界裡的操作對象、任務流程和技能組合,很難在訓練階段被提前窮盡。
傳統路徑中,一項新能力通常需要先變成數據,經過示範或交互採集、訓練或微調,再重新部署到機器人上。進入工廠、實驗室和家庭之後,這條鏈路會越來越重;尤其對於端側運行的模型,現場頻繁更新參數很難成為日常使用方式。Fi0因此把一部分新任務的適配放到了推理階段。對於已經掌握的任務,模型可以直接執行;遇到訓練覆蓋之外的技能,人類可以使用Ego頭環先完成一次demonstration。Fi0將這段示範作為當前任務的skill context,從中理解操作對象、任務順序、關鍵接觸和目標狀態,再結合當前環境與機器人自身的本體條件生成動作,整個過程無需更新模型參數。
這意味著,一項新技能不必先進入訓練集、等待下一輪模型更新,便可以直接進入機器人的執行過程。機器人可以帶著已有的通用能力進入場景,在遇到能力範圍之外的任務時,再通過上下文補充當前任務所需要的信息。這也為具身智能提供了另一種能力擴展方式:基礎模型持續擴大能夠直接完成的任務範圍,上下文學習則承接真實場景中不斷出現的長尾需求。隨著模型能力提升,需要額外示範的任務會逐漸減少,但這條在使用過程中接收新技能的通道仍然保留。因此,機器人不需要等到訓練階段覆蓋所有可能的任務,才開始進入真實世界。
△面對陌生任務,Fi0可以將一次人類示範作為技能上下文,在推理時理解任務,並結合當前視覺與本體信息,為不同機器人身體生成相適配的動作。從不同視角學習同一個世界 人類和機器人幾乎不會從相同位置觀察同一項任務。人類示範通常來自頭部第一視角,機器人則可能通過腕部、機身、頭部或外部相機感知環境。相機位置、視場和遮擋關係一旦改變,同一個物體在像素空間中的表現可能截然不同。但它們經歷的仍然是同一個物理過程。物體具有相同的狀態,抓取與釋放遵循相同的接觸規律,任務也沿著相同的階段推進。Fi0需要跨過視角差異,保留這些更穩定的世界信息。為此,Fi0引入Cross-view World Encoder。
人類第一視角和機器人視角分別經過視覺編碼,再通過跨視角預測與表示對齊,學習共享的世界表示,其中包含物體與機器人狀態、空間關係、接觸事件、任務進程以及未來動態。這層表示連接了人類經驗與機器人執行。模型需要能夠從人類第一視角和機器人腕部視角中識別“方塊已經被抓住”這一相同的物理狀態;同樣,機器人在真機執行中獲得的滑落、碰撞和接觸經驗,也可以繼續豐富模型對人類示範的理解。Fi0最終獲得的,並不是某一個視角下的視覺特徵,而是對物體和交互正在發生什麼的共同表示。只有建立了這層共享世界,人類示範中的經驗才有可能跨越相機和機器人本體,真正被模型複用。
△Fi0從人類的第一視角與腕部視角中,學習關於物體、交互、任務進程和未來動態的共享世界表示。將人類示範轉化為技能上下文 一段人類示範提供的,遠不止手部軌跡。當人伸手拿起方塊時,視頻同時記錄了對象選擇、接近方式、接觸建立、任務階段變化以及目標如何一步步推進。手部運動只是這項技能在人類身體上的具體表達,真正具有跨本體價值的,是背後的任務結構和交互邏輯。Fi0通過Skill Encoder將這些信息編碼為一組skill tokens,用來描述操作對象如何變化、任務經過哪些階段、關鍵接觸何時發生,以及目標狀態如何逐步達成。示範由此直接成為推理時的技能上下文,模型再結合當前環境和機器人本體生成動作。
這種設計對跨本體尤其關鍵。人手、剛性機械臂、柔性機械臂和雙臂系統擁有不同的結構與動作空間,一段人體軌跡很難直接轉換成所有機器人的控制指令;但它所表達的任務意圖、接觸關係、階段變化和目標狀態,卻可以被不同身體共同理解。Fi0因此希望保留下來的是一項技能“如何成立”的結構,再由當前機器人決定它具體“如何行動”。同一段人類示範可以由此成為多種機器人的共同任務上下文:它們共享對技能的理解,再按照各自的長度、構型、感知和驅動能力完成執行。這也重新定義了人類數據在Fi0中的價值。
人類示範不再只用於生成更多機器人訓練軌跡,它同時成為一種可以在推理時直接調用的技能載體,讓一段真實世界經驗有機會被不同機器人反覆複用。△Fi0將人類示範轉化為推理時的技能上下文,提取任務結構和交互邏輯,而不是複製與特定身體綁定的運動軌跡。模型不僅要控制身體,還要理解身體 跨本體模型除了理解任務,還必須知道自己正在控制怎樣的身體。一種常見做法,是給不同機器人分配Robot ID,讓模型據此切換對應策略。它可以區分設備,卻很難表達身體之間更深層的結構關係:A01和A02為什麼相似,增加一段柔性關節會如何改變可達空間,身體變長之後動作又應該怎樣調整。
Fi0因此將機器人表示為結構化的Embodiment Graph,並通過Graph Encoder生成Body Tokens。機器人的拓撲、節段、尺度、形態、感知方式、驅動能力和動態狀態,都可以進入這一本體表示,並與語言、視覺、技能和世界狀態一起參與動作生成與未來預測。這樣,Fi0面對的就不再是一組彼此孤立的機器人型號,而是一片具有結構關係的身體空間。當節段數量增加、身體長度改變或末端執行器更換時,模型可以根據本體條件調整動作。單臂、雙臂、多臂、長臂、短臂和不同節段組合,也由此從離散的設備類別,變成一組可以共同學習的本體。柔性機器人進一步放大了這個問題。
大多數剛性機器人在一次執行中可以將機械結構視為相對穩定的常量,而柔性本體會隨著動作、負載和接觸持續形變。身體狀態本身成為世界狀態的一部分,模型需要同時理解外部環境,以及自身正在發生怎樣的變化。這也解釋了擎羽為什麼選擇柔性機器人作為Fi0的核心研究平臺。長度、節段、形態和組合方式都可以連續變化,使模型能夠更直接地觀察身體參數如何改變可達空間、接觸方式和動作結果。Fi0在這樣的連續本體空間中學會區分哪些知識可以跨身體共享、哪些動作必須隨身體調整,其真實能力邊界也不侷限於A01、A02和A03,而是進一步延伸到更廣泛的機器人結構。
△Fi0將機器人的形態、感知、驅動方式和動態狀態表示為本體上下文,使共享技能能夠轉化為適合不同身體的動作。不只是生成動作,還要預測動作的後果 對於柔性本體,同一個目標往往對應多種身體構型和運動路徑。它們都可能在幾何上可達,卻會產生不同的接觸狀態、身體形態和任務結果。一條看似合理的路徑,可能碰偏物體,也可能讓機器人進入不利於後續操作的構型。Fi0因此不會直接執行單一動作,而是先根據當前本體生成一組候選方案。機器人的長度、自由度、實時形態和可達空間共同限定了它此刻能夠採取哪些行動;身體一旦變化,候選動作也隨之改變。這些候選動作隨後進入World Dynamics Model。
模型從當前世界狀態出發,分別向前推演不同動作在未來若干時間步可能帶來的變化,包括物體狀態、接觸關係和任務進程。預測得到的候選未來,再交給Multi-objective Action-World Assessment(MAWA) 評估。MAWA綜合任務進展、成功概率、物理風險和模型不確定性,對不同未來進行評分,並據此選擇下一步動作。這樣,Fi0對物理世界的理解就不再停留在感知層,而是直接進入決策。一個動作會形成怎樣的接觸、能否繼續推進任務、當前身體執行這條路徑存在多大風險,都會影響最終選擇。同一項技能在A01和A03上,也因此可以產生完全不同的動作方案。
A01可能傾向於更短、更直接的路徑,A03則可以利用更多節段形成不同的身體構型。World Dynamics Model分別預測這些動作可能帶來的未來,MAWA再選擇更適合當前任務和當前身體的方案。至此,Fi0的行動鏈路完整連接起來:技能上下文定義當前任務,共享世界表示描述物理狀態,Body Tokens提供本體條件,World Dynamics Model預測候選動作的未來,MAWA負責評估這些未來並完成最終動作選擇。△Fi0在執行之前,預測並評估候選動作在當前本體條件下可能產生的未來結果。邁向跨本體基礎智能 沿著Fi0的完整鏈路,任務、世界、身體和行動被組織進同一套模型框架。
語言和demonstration提供任務上下文,共享世界表示描述當前物理狀態,本體信息限定機器人如何行動,未來預測則用於判斷不同動作可能帶來的結果。更重要的是,這套框架讓機器人經驗有機會跨越單一身體繼續積累。模型已經獲得的任務結構、物體關係、接觸規律和世界知識,可以被不同機器人繼續調用;新的本體擴展模型接觸到的身體條件,真實執行產生的成功、失敗、接觸和恢復則繼續補充模型對動作後果的理解。面對訓練中尚未覆蓋的任務,人類示範還可以在推理時直接擴展機器人當下能夠處理的技能範圍。柔性本體為這套能力提供了一片連續變化的驗證空間。
A01、A02和A03沿長度、節段數量和自由度形成遞進關係,模型可以觀察身體參數的變化如何進一步改變可達空間、運動路徑、接觸方式和最終結果,從中學習任務知識與本體條件之間更細緻的關係。這種能力最終並不侷限於柔性機器人。製造、物流、醫療、家庭、太空和極端環境會需要形態差異很大的機器人,而任務與物理世界中的許多知識依然可以在這些身體之間延續。它改變的是每一副身體實現任務的方式。同一項技能到了A01、A03、雙臂系統或其他機器人上,可以擁有完全不同的軌跡、身體構型和接觸方式,同時指向相同的任務目標。
這正是Fi0的Foundation Intelligence Across Embodiments所指向的能力:身體可以變化,技能和對世界的理解仍然能夠繼續積累,並在新的身體上獲得新的行動表達。下一場具身智能競爭,可能發生在身體之間 人形機器人正在嘗試為通用智能找到一副足夠通用的身體。擎羽提出的則是另一個問題:當機器人開始擁有越來越多不同的身體,已經獲得的智能能否在它們之間繼續積累。這個問題會隨著機器人真正進入產業而變得越來越重要。工廠、倉庫、醫院、家庭乃至極端環境,對尺度、負載、速度、精度、順應性和安全的要求天然不同。
機器人身體很可能繼續圍繞任務分化,而行業真正需要解決的,將不只是“哪一種形態最通用”,還包括如何避免每出現一種新身體,就重新支付一遍數據、訓練和適配的成本。擎羽的技術路線正沿著這個方向展開。FEAGINE A01、A02和A03首先把柔性身體推進到標準化產品體系; 數據持續引入新的任務和真實世界經驗; Fi0再將任務、世界和本體組織進同一套基礎模型,讓一項技能能夠隨著身體變化重新生成行動。擎羽真正形成的資產,是任務、身體與物理世界之間不斷擴大的映射關係。這也讓柔性具身智能的含義最終超出了柔性機械結構本身。
身體可以圍繞任務改變長度、節段、形態和組合方式,智能則在這些變化之上持續積累,讓同一種技能在不同機器人上獲得各自成立的動作表達。人形路線正在不斷擴大一副通用身體能夠完成的任務邊界。擎羽走的是另一條同樣具有野心的路線:讓通用智能逐漸擺脫對某一副身體的依賴。當機器人世界從一種身體走向許多身體,真正具有複利效應的能力,正是讓每一副新身體,都能夠繼承此前對任務和世界的理解。版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界
世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤
作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。
數學自動形式化迎來重大突破:OpenBMB開源MathForm,8B模型憑實力逆襲大廠
OpenBMB團隊開源數學自動形式化框架、數據集與模型MathForm,目標是用Lean4讓機器準確讀懂並形式化驗證數學定理,攻克通用人工智能核心挑戰。其關鍵不是簡單翻譯自然語言,而是將每個數學概念精準映射到Mathlib庫中,為數學與AI交叉研究提供新工具。

加州伯克利數學教授撰文批評學生基礎差,卻被抓包“用 AI 寫的”
作者:清源 責編:清源 評論: 8 月 23 日消息,據英國《衛報》20 日報道,加州大學伯克利分校數學教授茲韋茲德利娜 · 斯坦科娃日前在《舊金山標準報》撰文批評部分學生存在“嚴重”的數學基礎缺失,卻又承認文章本身曾藉助 AI 編輯,由此引發爭議。

美國專家示警:學生依賴“AI 代寫”會削弱思考能力
作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。