具身智能技術路線尚未定型,基礎設施卻先收斂

2026年9月18日 21:24
具身智能技術路線尚未定型,基礎設施卻先收斂
站內 AI 整理稿

從一次成功到一萬次穩定執行,具身智能還缺什麼?田晏林 發自 凹非寺 | 公眾號 QbitAI 咋回事兒呢?機器人本體批量落地,行業要補的課反而更多了?別意外。本體數量上來了,具身智能乍看離規模化越來越近,但理解周圍世界、學習新任務、持續進化的能力,還沒法跟著機器人一起批量複製。和只在數字世界處理信息的通用智能體相比,具身智能要讓AI真正進入物理世界。一臺機器人學會一個動作不算最難,難的是繼續學會第二個、第三個任務;一項已經驗證的能力,能不能快速複製到更多機器人身上;換一座工廠、一個工位,甚至換一種本體,還能不能繼續跑。

說到底,行業關注的重點,正從如何造出機器人,轉向如何持續生產和迭代機器人的能力。9月16日,在2026智能經濟論壇上,百度集團執行副總裁、百度智能雲事業群總裁沈抖分享了一個判斷: 智能體的能力邊界在快速打開,已經能夠處理更長程的任務,也開始進入規模化部署。如果類比AI時代的發展,今天的AI有可能只是燈泡發明後的第一個月而已,因為燈亮了,所有人都看到了變化,但是電力帶來社會經濟分工的調整還沒有出現。當智能體進入產業系統,企業裡的知識、數據、流程、工具和具體要求,要被組織到真實場景裡,最終交付結果、創造價值,並持續進化。這個思路放到具身智能這個領域裡,要求只會更高。

機器人每一次執行,都會產生新的數據、誤差和現場反饋。這些經驗要能迴流到模型和系統裡繼續迭代,再沉澱成下一次可以複用的能力,機器人才能真正「越用越會」。於是,當機器人本體開始批量下線後,一個更關鍵的問題被推到臺前: 怎樣才能讓每臺機器人不斷學會新技能,並把一項已經驗證的能力穩定複製到更多機器人和場景裡?本體量產是起點,能力量產是下一步 本體已經走上產線,接下來,能力也得找到自己的「產線」。所謂「能力量產」,指的是把已經驗證過的具身應用技能,通過模型、數據和本體的持續閉環,以穩定且可控的成本複製到更多真實場景中。展臺上完成一次疊衣服、上下料,和在工廠裡連續做一萬次,是兩回事。

前者看一次成功,後者看任務成功率、人工接管率、單位任務成本、穩定運行時長,以及一項技能複製到更多機器和場景需要多久。而一項機器人能力,也從來不只取決於模型。「本體」解決身體如何規模化製造,「模型」決定能力上限,「數據和AI Infra」影響學習新技能的速度,「真實場景」則檢驗它能否從一次成功變成穩定成功。真機執行後產生的新數據,再回到下一輪訓練和驗證。但一個現實問題是,具身企業進入高頻迭代後,原本分散的算力、模型、數採、仿真和部署鏈路很容易互相拖慢。數據拿回來要處理,模型訓練完要仿真,仿真過了還要真機驗證,真機暴露新問題又得重新迴流。

看起來只改了一次模型,背後可能同時牽動算力、訓練框架、仿真環境、數據管線和部署方式。這也正是全棧基礎設施開始受到更多重視的原因。它要做的,是把數據、訓練、評測、推理和反饋等關鍵節點接成一條可重複運行的鏈路,讓同樣的時間和預算裡,企業能夠多跑幾輪試驗。「能力量產」要想真正轉起來,還要打通三個環節: 模型迭代效率、數據持續生產,以及跨本體和跨場景能力應用部署。機器人的能力,到底怎麼被生產出來?第⼀環:讓不同模型路線都能快速迭代 當前,VLA(視覺語言動作模型)、世界模型、全身運動控制等路線仍在並行演進,模型如何分工、世界模型如何接入、訓練範式如何調整,都還沒有完全收斂。

在百度智能雲主任架構師應茹看來,技術路線越不確定時,AI Infra越要保持通用和靈活。因為每改一次模型結構、訓練方式甚至仿真引擎,都要重新適配算力、訓練框架和部署環境,研發時間就會大量耗在工程配置上。她認為,企業真正需要的,也不只是某一次訓練快了多少,而是同樣預算、同樣時間裡,能不能多跑幾輪訓練、仿真和真機驗證。有人一週能跑3輪,有人3周才能跑一輪。時間拉長,試錯次數本身就是競爭力。百度智能雲旗下的AI算力基礎設施產品「百度百舸」,切入的就是這部分共性工程。

它把數據準備、開發訓練、仿真評測和推理部署接入同一套workflow(工作流),統一處理算力適配、訓練框架、資源調度、仿真環境和模型部署。以當前常見的5B到20B單體VLA、WAM(世界動作模型)為例,如果一味堆疊高配硬件,但顯存、帶寬和計算資源未必都能得到充分利用。SONIC模型訓練配方開源後,百舸將其集成到雲上,可一鍵擴展至128卡訓練規模;針對WAM模型的推理瓶頸,經過工程優化,相關測試中的推理延遲降至優化前的四分之一。這些優化最終都是為了縮短具身模型的迭代週期。本次論壇上,無界動力創始人兼CEO張玉峰直言,Physical AI的難點是「操作智能」。

為此,無界動力自研了快慢結合的MWA™具身大腦,並讓性能、技能和泛化並行推進,在工業、商業兩條場景線持續磨能力。每進入一個新場景,就帶回一批新數據。這也是它與百度智能雲合作的切入點。數據顯示,依託百度百舸AI計算平臺,百度智能云為MWA™具身大腦提供從數據處理、模型訓練、仿真評測到真機推理部署的全棧支持,訓練有效時長超過99.5%。模型研發和場景數據只有同時轉起來,能力才能持續生長。第⼆環:把真實操作轉化為可訓練的數據 互聯網已經給LLM留下了海量文字,但機器人想學會擰一顆螺絲、裝一個零件,網上幾乎找不到完整教材。

具身數據往往同時包含視覺、動作、空間關係、力覺、本體狀態和時序關係,而且和具體本體、任務、現場高度綁定。數據採回來,後面還有清洗、切片、標註、質檢、管理、訓練、評測。當前具身智能的數據難題不只在於數量,更在於數據能否持續生產並高效週轉。在東莞,由東莞市及萬江街道方面投入建設、百度智能雲承建運營的具身智能訓練場已投入運轉。百度也在這裡落地了大灣區首個實體化具身智能採標實驗室,提供數據工具鏈、百舸算力底座和訓推平臺,為機器人做真機採集、標註、仿真和模型迭代。

作為技術賦能和場景鏈接服務方,百度智能雲充分發揮自身在具身智能基礎設施方面的優勢,鏈接具身產業鏈上下游共創合作方,共同為東莞製造業智能化升級提供場景賦能。該訓練場規劃了13個真實產業場景,覆蓋傢俱製造、3C電子、五金模具、物流倉儲,配置50臺套異構本體,並持續部署Ego、UMI等100餘臺無本體設備。這些產業場景緊扣東莞產業優勢和特色,把本地製造業剛需直接轉化為機器人訓練任務。數據生產分成三條路:真機遙操作保證真實性,無本體採集降低成本並擴大規模,仿真和算法生成補充多樣性。東莞具身智能訓練場也將採集的數據統一納入具身智能數據採標管一體化平臺管理。不僅如此,訓練場還承擔「中試」功能。

機器人可以先試訓,再中試,最後進廠,相當於把大量試錯從正在生產的客戶產線上提前搬出來。由此,這裡不再只是單點數據車間,而是一個具身智能行業的綜合性工業實訓載體。目前,該平臺已經服務35傢俱身智能企業。數據的規模只是表層,能否把真實現場持續變成機器人可學習、可驗證、可迴流的經驗,才決定能力生產線轉得有多快。第三環:能力還得穩定落進機器人身體裡 模型訓練完成,只是能力形成的一半。機器人面對真實用戶時,得聽懂、理解、及時響應、正確執行,還要長時間穩定運行。模型部署、語音交互、端雲協同、安全和本體適配,都會直接影響最後的產品體驗。消費級具身智能機器人品牌上緯啟元,是一個典型例子。

它面向個人和家庭場景推出Q1、T1兩款機器人。圍繞Q1、T1,百度百舸提供統一的模型訓練、微調、推理和測試環境,並集中管理AI任務、數據流轉與彈性算力調度,使模型研發能夠在同一套環境中持續迭代。“百度百舸AI計算平臺在我們Q1、T1型機器人的研發過程中,提供了統一的模型訓練、微調、推理和測試環境,實現了AI任務的集中管理和算力資源的彈性調度。”上緯啟元首席科學家董豪表示。上緯啟元首席科學家董豪 而且他發現,在數據高效流轉、模型訓推加速等方面,顯著提升了模型開發效率,縮短了實驗閉環與算法迭代週期。不過,具身智能要在現實世界中規模化落地,硬件系統同樣重要。

對這類產品來說,用戶最關心的,是叫它的時候能不能聽見,聽見之後能不能理解,理解之後能不能及時做出正確反饋。據董豪介紹,百度智能雲全棧AI能力也提供了系統化的支持。在產品交互層,百度智能雲的語音交互能力補上了機器人與用戶直接溝通的關鍵環節。一臺面向真實用戶的機器人,背後已經是多個系統共同工作。「模型」負責理解和決策,「語音交互」負責承接用戶意圖和反饋,「端雲協同」影響響應效率,「安全能力」決定系統能否長期穩定運行。而且,這套底層支撐還要適應不同形態的機器人。工業機器人看重節拍、穩定和精度,個人機器人面對開放環境、高頻交互和更復雜的用戶需求。

只有跨本體、跨場景的適配能力建立起來,一項已經驗證過的技能,才有機會真正複製出去。50多家公司背後,基礎設施需求正在出現共性 無論做工業、商業還是家庭機器人,企業最終都會反覆碰到同一組底層問題,模型怎麼更快迭代,數據怎麼持續迴流,本體怎麼穩定部署,能力又怎麼進入真實場景完成驗證和複製。再看百度智能雲其他的合作伙伴:千尋智能、智元機器⼈、銀河通⽤、宇樹科技、星動紀元、跨維智能、星塵智能等企業,雖然產品形態、技術路線和目標場景各不相同,卻也在集中暴露出相似的基礎設施訴求。比如千尋智能,和百度智能雲的合作直接落在訓練效率上。據瞭解,千尋智能接入百舸後,有效訓練時長達到98.

8%,核心指向就是減少底層資源和工程問題對模型研發節奏的打斷,讓更多時間真正花在模型迭代上。智元機器人則放在更廣的全棧AI雲框架下看。它與百度智能雲的合作重點不只是一塊算力,而是隨著機器人研發和產品推進,持續調用模型訓練、數據處理、部署等底層能力。當然,這些案例不能代表整個行業,卻足以說明,具身智能企業走到研發提效和規模落地階段後,底層基礎設施需求正在浮現出越來越強的共性。模型側需要提高訓練、推理部署效率; 數據側需要貫通採集、標註、管理; 本體側要解決交互、端雲協同、安全與適配等問題; 進入場景後繼續完成規模複製。儘管具身智能的技術路線還在百花齊放,但基礎設施需求已逐步收斂。

行業分工因此變得更清晰。模型路線、產品定義、場景經驗,依然是具身企業自己的核心競爭力。算力調度、訓練加速、數據處理、仿真評測、推理部署這些每家公司都會重複遇到的工程問題,則越來越適合沉到公共基礎設施層。百度智能雲目前的佈局,沿著這條鏈路展開。模型側,百舸提供訓練、推理和算力調度。數據側,提供採集、標註、管理、評測的一整套鏈路。本體側,補上語音交互、安全和端雲協同能力。場景側,通過訓練場和中試平臺繼續完成驗證和複製。全棧AI雲的價值由此變得更具體。它把能力生產過程中反覆出現的共性環節,做成一套可以被不同企業複用的底座,讓具身企業把更多資源放回模型、產品和場景本身。

目前,百度智能雲已經為產業鏈上超過50家重點具身企業,提供了全棧AI雲技術支撐。國際數據公司(IDC)發佈的《中國具身智能雲市場份額報告,2025》也提到,百度智能雲以29.55%的市場份額,同樣位居第⼀。國際權威市場調研機構英富曼(Omdia)也給出了相同排名。雙報告第一。這些數字背後,更值得關注的是一個產業變化: 當越來越多不同路線、不同本體、不同場景的公司,開始調用相似的底層能力時,具身智能的競爭已經開始延伸到能力生成效率。在具身智能技術路線尚未定型的階段,企業未必需要提前押注唯一答案,但必須保證自己還能繼續試。模型可以換,訓練範式可以換,本體可以換,場景也會繼續變化。

這就要求企業需快速搭建一套基礎設施:既能承接模型迭代,持續沉澱數據,又可實現跨本體遷移部署。未來的競爭,不只是誰先做出一項能力,也是誰能更快完成驗證、複製和迭代。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

IT之家AI Agent

長安汽車首席專家譚歡:未來要用機器人造車、賣車,讓機器人上車、造機器人

作者:清源 責編:清源 評論: 9 月 18 日消息,在今天(18 日)的第 22 屆中國汽車產業發展(泰達)國際論壇“新賽道生態專場:具身智能新賽道”活動中,長安汽車首席專家、長安天樞智能機器人公司總經理譚歡在演講中指出,AI 正推動以物理具身智能為核心的基礎設施革新,汽車未來形態是“汽車機器人”—— 自學習、自組織、自進化的組合智能體。

54 分鐘前

88小時抵一個人思考4000年,OpenAI核心研究員:除了自我進化,更可怕的是AI正學會“隱藏自己”

AI正在把4000年的人類認知勞動壓縮進88小時,OpenAI研究員Noam Brown坦言連他自己也被進展速度持續震驚。AI正在把過去需要數千年完成的認知勞動壓縮到數天。真正的問題已經不只是模型能否變得更聰明,而是實驗能否跟上、人類能否在模型繼續自我改進前確認它仍然安全。

2 小時前
智東西AI Agent

Agent辦事、花式P圖、動嘴玩電腦……實測Wildcat Lake輕薄本玩AI有多爽

作者 | ZeR0 編輯 | 漠影 桂林依山傍水,連城市的輪廓,都是一座座山勾勒出來的。抬眼一望,便是翰墨丹青般的自然光景,既沉靜婉約,又意境悠遠。這種乾淨的留白之美,早已被古人融入山水畫藝中,幾筆山石,一帶煙雲,餘下的留給水色,也留給看畫的人。 淨,並非空無一物,而是通過剋制的取捨,讓真正重要的東西凸顯出來。這與今年推出的第三代英特爾酷睿處理器(代號Wildcat Lake)的設計理念不謀而合。

8 小時前
AIbaseAI Agent

吳恩達回應AI末日論:別被科幻敘事帶偏,應解決現實工程問題

吳恩達曾參與創辦Google Brain和Coursera。吳恩達稱,科技行業早期曾放大AI潛在災難性風險,以獲取關注並影響監管方向;近兩週相關討論再次升溫,也可能存在類似動機。他認為AI確實存在現實風險,尤其包括網絡安全等領域,但不認同將人類滅絕風險作為當前AI發展的核心判斷依據。

9 小時前
IT之家AI Agent

智譜 GLM-5.3-FlashX 模型上線,更快、更流暢

作者:汪淼 責編:汪淼 評論: 感謝網友 Agent 的線索投遞!9 月 18 日消息,智譜今日宣佈推出 GLM-5.3-FlashX(最高 200 tokens/s),為企業與開發者帶來更快、更流暢的模型體驗。智譜官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名與全球開發者見面,獲得海內外開發者的廣泛認可,調用量持續攀升。

10 小時前
智東西AI Agent

華為發佈AI行業落地新路徑:“七步法”、“垂直作戰組織”、“DIMAK”

作者 | ZeR0 編輯 | 漠影 9月18日報道,今日,在華為全聯接大會2026上,華為發佈了“AI落地七步法”與“DIMAK工程體系”,依託行業垂直作戰組織,以“新方法、新組織、新工具”破解Agentic AI深度嵌入行業核心場景、規模化應用難題。 “AI落地七步法”是面向行業推動場景落地的關鍵步驟路線指南,回答“怎麼走”; “DIMAK”工程體系,則回答“用什麼走“,提供五類工程工具,支撐企業快速用好AI。 華為還發布了《Agentic Enterprise 企業智能化白皮書》,並公佈了157個數智化轉型實戰案例,為全球產業智能化升級提供參考。 “企業流程未來將圍繞人和人工智能協同設計,這不是在舊馬車上裝發動機,而是要重新設計一輛汽車。”華為監事會副主席陶景文談道,為此,華為提出以“新方法、新組織、新工具”,搭建算力與場景的“路與橋”,讓AI沿價值業務流實現蓋爾定律式的擴散,完成從單點智能向系統智能升級和跨越,幫助千行百業善用AI。 一、新方法:“七步法”讓AI紮根生產系統 對於Agentic AI深度嵌入企業系統的難題,陶景文表示,華為總結了“AI落地七步法”,從核心場景切入,形成“小切口、大縱深”,並沿價值業務流進行擴散,旨在為產業智能化提供一張可複製的路線圖。 該方法涵蓋“洞悉行業商業邏輯、選擇行業核心場景、技術與工程攻堅、核心場景部署投產、沿價值業務流擴散、行業生態發展合作、持續提升行業智能水平”七大步驟,核心體現在三個維度。 選準場景:“找到對的場景,就成功了一半。”強調由業務專家與AI技術專家組建聯合團隊,沿價值業務流,運用“場景十二問”方法論精準鎖定高價值生產場景。 深度紮根:區別於停留在演示層面的實驗性AI,“七步法”以真實上線、投產運行為目標,要求從MVP(最小可行產品)到投產,需集成到生產系統,部署在企業IT基礎設施上進入常態化運營。

13 小時前