王田苗三問具身大牛:大模型還在「撥號上網」,機器人靠什麼拿下真實訂單?| WRC 2026
當狂熱的資本逐漸冷靜,具身智能行業必須面對一場從“展示Demo”到“真實產線”的生死大考。編輯丨岑峰 “如果大模型現在還處在‘撥號上網’的時代,那誰能告訴我,制約具身智能規模化的致命卡點到底是什麼?大模型解決物理世界問題的巔峰時刻,究竟何時到來?”在 2026 世界機器人大會(WRC)的一場重磅圓桌論壇上,北京航空航天大學教授、中國機器人學術泰斗王田苗,向臺下的五位具身智能頭部企業 CXO 拋出了這個極度尖銳、甚至有些不合時宜的冷水式提問。過去兩年,大模型的狂飆將具身智能推上了風口浪尖。一段段炒菜、疊衣、甚至後空翻的視頻在社交網絡上瘋傳,彷彿 AGI降臨物理世界已是近在咫尺。
然而,離開聚光燈和精心佈置的實驗室,這些動輒標價數十萬的機器人,真能在現實中的工業流水線和和凌亂的家庭環境中活下來嗎?2026 年被行業公認為“具身智能規模化應用元年”。但在王田苗給出的數據裡:今年中國的人形機器人累計交付僅在 1.5萬臺左右,而傳統的工業機器人出口額卻早已突破百億大關,並保持著近 20% 的穩健增長。理想與現實之間的巨大鴻溝,亟需一次毫無保留的行業“底牌大揭秘”。制約人形機器人從“幾臺Demo”走向“萬臺交付”,進而吃下海量真實訂單的“卡點”究竟在哪裡?大模型的算力奇蹟,為何在面對物理世界的幾個螺絲釘時頻頻失效?
在軟件與硬件、平臺與垂類的生態博弈中,未來的具身智能又將走向“蘋果式”的贏者通吃,還是“Windows式”的百花齊放?在這場聚集了眾擎機器人 CEO 趙同陽、加速進化 CEO 程浩、具身科技聯合創始人劉宇龍、優必選副總裁焦季超,以及京東智能機器人業務部負責人徐磊的頂級圓桌上,五位具身智能第一線的掌舵者,圍繞“真實量產的卡點”、“軟硬解耦的終局”以及“商業化落地的真實節奏”,展開了一場極具啟發性的產業交鋒。01靈魂第一問:卡住“萬臺量產”脖子的,到底是大腦還是供應鏈?當大模型賦予了機器人“聽懂人話”的能力後,許多人樂觀地以為,機器人走向千家萬戶只剩下成本問題。
但王田苗的問題直擊大規模落地的“最後一釐米”:“制約巨身智能機器人走向萬臺交付的卡點,主要在什麼地方?”在這道必答題面前,現場嘉賓迅速分化成了截然不同的兩大陣營:“技術派”與“工程派”。那麼,阻礙機器人拿到“萬臺入場券”的真兇到底是誰?現場迅速分化為兩大陣營:“算法技術派”與“製造工程派”。“算法技術派”認為,原罪依然在那個還不夠聰明的大腦。眾擎機器人 CEO 趙同陽一針見血地指出了軟件思維與硬件現實的錯位。他指出,當前業內宣稱的具身大模型操作成功率大多在 96% 左右。這在軟件和互聯網世界,或許是一個足以支撐產品上線的優秀數字;但在真實的物理世界,這卻是致命的。
“這意味著機器人如果走出去執行 100 次任務,有 4 次不能活著回來,或者會砸壞客戶的產線。這是一個極其糟糕的事情。”趙同陽坦言,真正的商業化落地,尤其是 To B 的工業場景,絕對不會接受 96% 的良率。大模型面臨的當務之急,不是去炫技做更多花哨的動作,而是如何將穩定性和可靠性從“兩個 9(99%)”死磕到“三個 9(99.9%)”甚至“四個 9(99.99%)”。只要大腦的決策還存在隨機性崩潰的風險,萬臺量產就是一句空話。加速進化 CEO 程浩對此表示高度認同。
他拋出了著名的 TPMF(Technology Product Market Fit)理論,認為當前具身智能的需求一直都在,產品定義也沒有多難,真正的卡脖子環節就是“技術不 Ready”。程浩將當前的具身大模型技術路線形容為“派系林立但遠未收斂”。有人做分層架構,有人做 VLM(視覺語言模型)與VLA(視覺-語言-動作模型)的融合,但真正能扛住工程化落地檢驗的“端到端大模型”至今沒有出現。“現在距離大規模落地,最關鍵的還是卡在大腦的可靠性上。”然而,身處真實生產與交付第一線的嘉賓,卻給出了截然不同的答案。“大腦只要做到‘夠用’就行。
”具身科技聯合創始人劉宇龍透露,截至 2026 年 6 月,具身科技已經完成了約 15000臺機器人的量產交付,其中包括上萬臺四足機器人。在“見過血”的劉宇龍看來,大腦的成熟度固然不夠理想,但在特定的垂類場景下,現有的算力和算法已經能夠解決特定的剛需痛點(如從A 地搬運貨物到 B 地)。他認為,真正的卡點在硬件指標和製造標準。比如機器人的自重負載比、高低溫環境下的MTBF(平均故障間隔時間)等。“我們在萬臺交付過程中遇到的最大痛苦,是如何保證所有批次出貨的良率、工藝一致性。”劉宇龍指出,具身智能缺乏像汽車、家電那樣成熟的行業標準,上下游供應鏈仍在盲人摸象,這才是量產最大的絆腳石。
優必選副總裁焦季超補充道,真實的客戶並不會去實驗室裡苛求 4個9 的極致成功率:“客戶只關心,我用機器人替代這個工位,ROI能不能在兩三年內算過來?你的採購成本和後續的運維成本到底是多少?”優必選今年即將形成萬臺級的產能,焦季超坦言,從 100 臺到 10000臺,對產線的生產製造流程帶來了巨大的挑戰。“我們去年就經歷過,前 100 臺和 100 到 200臺的生產過程中,發現需要做修正,但我能不能快速找到工廠跟進?目前整個行業還沒有形成一套標準化的 NPI(新產品導入)流程和質量管控體系。
”在技術與工程的爭論之外,京東智能機器人業務部的徐磊則從商業視角進行了補充:“除了技術之外,最大的卡點是供需關係的匹配。”作為掌握著海量銷售數據與真實部署場景的“超級渠道”,徐磊爆出了一個令人深思的內部數據:“目前具身智能機器人的轉化率,比傳統的手機數碼產品要差數十倍。”他指出,大家都在談論 AGI時代的通用智能,但在當下做出的產品是否真正滿足了用戶的剛需?是否創造了不可替代的價值?“如果我們的產品只能提供噱頭,而不能算清楚投資回報率(ROI),那麼萬臺以上的交付根本無從談起。”02第二問:大模型如何馴服物理世界的不確定性?
當“卡脖子”的陣痛逐漸被視作量產路上的必經關卡,王田苗教授的第二個問題,直接觸及了具身智能的技術靈魂:相比起已經非常成熟、穩定運行數十年不出錯的傳統工業機器人,“通用智能”本身的可靠性究竟該如何保證?王田苗拋出了一個令在場大牛們無法迴避的客觀事實:傳統工業機器人的無故障出錯時間大約是 6 到 8 萬小時;而在極端的工業製造環境下(如精密電子組裝、危險化學品處理),容錯率必須為 0。這實際上觸及了目前 AI 界爭論最激烈的話題:基於概率分佈的 LLM,能否勝任物理實體的零誤差操作?優必選的焦季超直擊了具身大模型在物理世界頻頻失效的一個隱蔽元兇:硬件本體的非標準化帶來的“跨本體遷移”難題。
焦季超指出,現實物理世界遠比純粹的數字代碼複雜得多。哪怕是同類機器人,只要電機參數存在細微的不一致,或者構型存在極小差異,都會導致傳感器採集到的真實數據大相徑庭。“從模型和方法論的角度來看,跨本體的遷移目前面臨著極大極大的挑戰。”焦季超坦言,這就導致了一個讓算法工程師極其頭疼的局面:在 A 款機器上喂足了數據、訓練得非常完美的模型,一旦平移到 B 款機器上,就會因為物理參數的錯位而頻頻出錯,必須花大力氣進行人工“特調”。物理世界對微小誤差的零容忍,讓原本在軟件世界裡無往不利的“通用大模型”,在殘差不齊的物理軀體面前撞了一鼻子灰。然而,如果依然是要解決複雜任務的精確執行,大模型的演進方向在哪裡?
焦季超和具身科技的劉宇龍一致認為,連接虛擬大腦與物理身體的“橋樑”依然脆弱,而修補這座橋樑的核心材料是“多模態數據”。“現有的通用大模型(LLM)主要是靠互聯網文本數據喂出來的,但對於具身智能來說,我們需要觸覺、力覺、視覺等多維度的真實交互數據。”焦季超一針見血地指出,高質量具身數據的獲取手段目前極不成熟,數據量遠遠達不到湧現物理常識的門檻。更深層的問題在於底層架構。焦季超認為,目前許多具身大模型仍是基於 Transformer 等自然語言處理架構“魔改”而來的,並不完全適配具身智能“感知-決策-控制”的閉環訓練範式。“未來一定會出現一個專用於具身的動態模型新架構。
只有完成底層架構的重構,才能真正抹平大腦指令與物理動作之間的微小誤差。”眾擎機器人的趙同陽則從工程師的痛苦中看到了大模型的不可替代性。“如果用傳統工業算法,每天面對客戶碎片化的需求,工程師的數量是遠遠不夠的。大模型的價值在於它對多任務的泛化求解能力。”儘管大模型目前不夠穩定,但它是應對無盡長尾場景的唯一解。加速進化的程浩則用一個極其生動且切中要害的比喻,緩解了在場嘉賓對“大模型不靠譜”的集體焦慮。“大模型現在太早期了,我們目前正處於具身智能的‘撥號上網時代’。”程浩比喻道,現在行業和用戶的預期是“5G 時代”——要求機器人能跑能跳、能做家務還能工廠打螺絲。
但現在的技術基建,可能連 3G 都算不上。在這個階段,去死摳單一的容錯率卡點是沒有意義的,因為從電機的扭矩、減速器的材料、算法的架構到邊緣計算的通信延遲,到處都在拖後腿。“但這並不意味著撥號上網時代沒有商業價值。大家回想一下,當年撥號上網、網速只有幾 KB 的時候,全球每年的計算機銷量依然有幾百萬甚至上千萬臺。因為像雅虎、早期 BBS 這樣的簡單應用,已經能夠滿足一部分真實的商業需求了。”程浩認為,大模型在具身智能上的應用絕不是“憋大招”式的黑天鵝事件,而是一個螺旋式上升、漸進演化的過程。它必然會在一次次降維落地、試錯與真實數據的反芻中,最終跨越容錯率的鴻溝,迎來屬於它的“5G 巔峰時刻”。
03第三問:終局推是“蘋果模式”還是“Windows模式”?當大模型真正跨越了物理世界的鴻溝,具身智能產業走向成熟,它的終局生態究竟會呈現何種面貌?王田苗拋出了全場最具戰略高度的一問:未來的具身智能,會是一家巨頭吃下從大模型到硬件本體的全部利潤(類似蘋果iOS的封閉生態);還是會像 PC 和智能手機早期那樣百花齊放:做本體的、做大模型的、做供應鏈的,各自稱王,形成軟硬解耦的分工格局(類似 Wintel 或安卓模式)?在這場交鋒中,“軟硬一體”的呼聲佔據了上風。眾擎機器人的趙同陽態度極其堅決:“綜合的靈魂一定要統一,所以兩個(硬件和軟件)都要做。
”他認為,如果只想做一個邊緣的代工廠,那大可不必碰大模型;但要想成為偉大的人工智能企業,“靈魂和肉體必須一體”。趙同陽認為,人形機器人的市場空間足夠龐大,甚至比智能手機更誇張。在這樣的體量下,市場一定會收斂出兩三家像蘋果、微軟一樣的超級巨頭,切走行業 80%的利潤,而剩下的 20% 留給做垂類專用的長尾企業。優必選的焦季超同樣站隊“軟硬一體”。他給出的理由更加技術化:“人形機器人的複雜度在於硬件和軟件的深度耦合。比如電機的參數不一致、本體構型不同,會導致你採集的數據完全不一樣。跨本體的模型遷移,目前在技術上仍面臨巨大挑戰。
”焦季超堅信,通往 AGI 最短、最佳的路徑,一定是硬件與軟件的深度匹配與自研。“我不認為未來的硬件和軟件能夠輕易分開。”但加速進化的程浩給出了截然不同的推演邏輯。他認為,長期來看,軟硬件必定會走向“解耦(Decoupling)”,只是現在時機未到。他將具身智能的產業革命劃分為三個階段:1.本體階段(現在): 處於百花齊放的階段,就像計算機剛誕生時,Apple、IBM 各自為戰,系統和硬件緊密綁定,因為大家都沒跑通。2.Agent 應用階段(近期): 隨著基礎系統的成熟,硬件本體開始收斂,但上層的應用會迎來爆發期,就像移動互聯網早期的 App Store,各類垂直場景的Agent 爭奇鬥豔。
3.模型階段(終局): 通用具身大模型(Foundation Model)徹底成熟,並像微信、抖音一樣“吃掉”絕大部分的長尾應用。“到了那個時候,終局最大的贏家一定是那家做大模型的公司。社會將進入一個由超級大模型統治的時代。”程浩判斷,雖然短期內由於技術不成熟必須軟硬一體,但隨著標準化的確立,軟硬解耦是不可阻擋的歷史規律。京東的徐磊也從產業鏈的角度印證了這一趨勢。他透露,京東目前正在推進人類歷史上規模最大的具身數據採集計劃(包括千萬小時真實場景數據和百萬小時真機採集)。
他認為,儘管當下是百花齊放,但隨著“跨環境、跨本體”的大模型預訓練技術不斷突破,未來的基礎大模型一定能在通用的硬件本體上展現出極強的跨用能力。04 在“撥號上網”的陣痛中,尋找進化的鑰匙當長達一個多小時的圓桌接近尾聲,王田苗教授的三個靈魂拷問,終於為瘋狂奔跑的具身智能行業,拼湊出了一幅褪去濾鏡、極度真實的產業圖景。不可否認,大模型確實還處在具身智能的“撥號上網”早期階段。它離“5G 時代”那無所不能的通用人工智能,仍有漫長且險惡的算力鴻溝、數據荒漠與架構壁壘需要跨越。
無論是面對大模型頻頻“手抖”的幻覺焦慮,還是面對“蘋果式巨頭”或“Windows式生態”的終局推演,擺在在座所有明星企業面前最冷酷的現實問題是:夢想很宏大,但今年和明年,我們靠什麼活下去、賺到錢?在圓桌的最後,五位頭部企業的掌舵者,對於商業化落地的“宏觀節奏”達成了共識:摒棄一步登天、直達 AGI 的幻想;遵循從高剛需、低容錯、半結構化的 B 端(企業級)場景切入,最後再圖謀複雜多變、容錯率低的 C 端(家庭)市場的演進路線。具身科技的劉宇龍分享了他們極其現實的打法:“我們是一個 2024 年才起步的年輕公司,切入點是四足機器人的巡邏巡檢和應急消防。
說白了,就是讓人形或四足機器人去幹那些人類覺得危險、高重複、極度疲勞的髒活累活。”在這些場景中,痛點是剛需,頻率極高,客戶算賬的 ROI 邏輯非常清晰,這也是他們能率先實現萬臺交付的秘訣。優必選的焦季超也預測,隨著技術的成熟和成本的下降,工業端的放量將是明後兩年的重頭戲。“先把容易實現的巡檢、搬運、分揀做透,再去碰那些需要穿針引線的精細活。”有趣的是,在這個硬核的機器人論壇上,“情緒價值”被反覆提及。焦季超坦言,優必選今年發佈的偏向情感陪伴的 C 端產品需求遠超預期。“這種能做出微表情、能產生情感共鳴的陪伴機器人,市場需求極其龐大。
”京東的徐磊同樣證實,雖然整體 B 端需求大於 C 端,但在 C 端市場中,具身類的陪伴聊天機器人增速最為迅猛。徐磊甚至勾勒了一個“去中心化交互”的未來:在萬物互聯的具身時代,我們不再需要掏出手機,對著桌子或家庭機器人說一句話,一切服務就能自動完成。“技術和產品必須達到一個適中的狀態。”眾擎機器人的趙同陽用一句話為這場圓桌作了結。在這個大模型還在“撥號上網”的時代,沒有一家公司能一口吃成胖子。
最聰明的做法,是用 80% 的精力去搶佔巡檢、安防、工業搬運等確定性極強的“沙頭堡”,通過這些粗活累活造血;然後,再把剩下的 20% 留給實驗室,去探索那個虛無縹緲卻又令人神往的、能真正走入千家萬戶的 AGI 終局。畢竟,只有留在牌桌上的人,才有資格見證巔峰時刻的到來。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。