具身智能還在“前GPT時代”

重點摘要
具身智能当前仍处于类似GPT诞生前的技术积累期,尚未迎来标志性的“ChatGPT时刻”。算法、硬件与数据之间的协同尚未实现闭环,多模态融合与物理世界交互仍存在大量工程瓶颈,行业整体在研究范式和落地路径上仍处在探索阶段。 今年被定义为“跑通年”,意味着行业重点从炫技转向验证基础可用性。
具身智能(Embodied Intelligence)當前正處於一個關鍵的技術醞釀期,業界普遍認為,這個領域尚未迎來屬於自己的「ChatGPT 時刻」。正如大型語言模型在 GPT 系列問世之前經歷了漫長的演算法、數據與算力磨合,具身智能現在也同樣處在從理論走向實質突破的前夜。儘管近年來機器人在特定展示場景中的表現屢屢讓人驚豔,但整體而言,從實驗室炫技到真正可用的基礎能力驗證,行業仍有一條充滿工程挑戰的路要走。所謂具身智能,指的是能透過物理身體在現實世界中感知、推理並執行任務的人工智慧系統,最典型的載體便是各式機器人。
與純粹的語言模型不同,具身智能不僅要處理符號與機率,還必須應對真實環境中不可預測的物理變化,這使得演算法、硬體與數據之間必須形成緊密的協同閉環。然而,截至目前,這三者之間的循環尚未真正打通。多模態感知資料如何與運動控制的即時決策無縫對接,依然是困擾全球研究團隊的核心問題。從技術發展的歷史座標來看,今天的具身智能處境與 GPT 系列誕生前的自然語言處理領域極為相似。當年業界雖然已經有大量的語言模型與序列生成技術,但直到 GPT-3 乃至 ChatGPT 的出現,才讓大眾和產業真正看到通用語言能力的爆發可能。
如今的機器人領域雖然在避障、抓取、導航等單一技能上累積了不少成果,但一旦要將這些能力整合進一個連續的任務流程中,系統的穩定性與泛化性就會出現顯著衰減,而這正是「前 GPT 時代」的典型特徵。正因如此,今年被業界定義為具身智能的「跑通年」。這個詞的出現意味著整個行業的發展焦點正在轉移:從過去追求單點功能的驚豔表現,轉向驗證系統在有限場景下的基礎可用性。過去幾年,機器人後空翻、精細操作等 demo 層出不窮,但多數仍停留在展示階段,距離實際部署還有遙遠距離。現在,研發團隊更在意的是,能否讓機器人在一個具備明確邊界的場景中,從頭到尾自主完成一個有意義的任務。
「跑通」的具體內涵,包含從穩定行走、精準抓握到簡單決策的一連串能力。舉例來說,一台服務機器人若要完成「從桌面拿起水杯並送到指定位置」這個動作,它必須先穩定移動到桌邊,透過視覺或觸覺辨識出水杯的位置與方向,以適當的力道進行抓取,接著在移動過程中保持物體不滑落,最後在目標點準確釋放。整個流程看似簡單,卻需要感知、定位、運動控制、力回饋與任務規劃等多個模組的即時協作。目前多數研究團隊正在嘗試打通這個從感知到執行的完整鏈條。不同於過去只優化其中某一環節,現在的系統設計更強調端到端的閉環測試。一旦任務中途出現誤差,系統必須能夠即時感知並修正,而不是中斷或完全依賴遠端人類干預。
這對演算法的即時性與硬體的可靠性都提出了極高要求,也使得多模態融合與物理世界互動的工程瓶頸變得更加具體而迫切。此外,成本與可複製性也是「跑通年」的另一個核心課題。即便能在特定實驗室環境下展現出流暢的任務能力,如果硬體成本高昂、部署流程繁複,依然無法推動產業進入規模化應用的階段。業界普遍認為,唯有在有限場景內實現低成本、可複製的「跑通」,才有可能讓具身智能從摸索期的示範專案,過渡到真正具有商業與社會價值的應用爆發前夜。某種程度上,當前的「跑通」驗證,與當年語言模型逐步從問答系統走向通用對話助手的路徑類似。
並不是等到所有技術點都完美才迎來爆發,而是在某個有限但夠實用的場景中,先讓用戶看見穩定且可複製的價值。一旦這道門被打開,後續的資料累積與模型迭代便會加速滾動,最終推動整個領域跨越到新的階段。從整個產業的動態觀察,無論是學術界還是新創團隊,都在加速布局具身智能的基礎驗證工作。許多研究不再急於發表驚人的展示影片,而是將精力花在提升任務成功率、降低硬體故障率,以及讓同一套系統能夠在不同環境中複製相同的表現。這種心態上的轉變,正是領域逐漸成熟的跡象。當然,從「跑通」到真正迎來具身智能的 ChatPGT時刻,依然需要時間。
但正如當年沒人能精準預測語言模型會以何種形式引爆一般,業界也無法斷言這個轉折點何時會降臨。唯一可以確定的是,現在每一支在實驗室裡反覆調整參數、打磨任務閉環的團隊,都在為那個尚未到來的突破累積必要的條件。而當足夠多的基礎可用性被驗證之後,具身智能的爆發或許就會悄然降臨。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。