鈦媒體生成式AI

具身智能還在“前GPT時代”

2026年7月20日 10:56
具身智能還在“前GPT時代”

重點摘要

具身智能当前仍处于类似GPT诞生前的技术积累期,尚未迎来标志性的“ChatGPT时刻”。算法、硬件与数据之间的协同尚未实现闭环,多模态融合与物理世界交互仍存在大量工程瓶颈,行业整体在研究范式和落地路径上仍处在探索阶段。 今年被定义为“跑通年”,意味着行业重点从炫技转向验证基础可用性。

站內 AI 整理稿

具身智能(Embodied Intelligence)當前正處於一個關鍵的技術醞釀期,業界普遍認為,這個領域尚未迎來屬於自己的「ChatGPT 時刻」。正如大型語言模型在 GPT 系列問世之前經歷了漫長的演算法、數據與算力磨合,具身智能現在也同樣處在從理論走向實質突破的前夜。儘管近年來機器人在特定展示場景中的表現屢屢讓人驚豔,但整體而言,從實驗室炫技到真正可用的基礎能力驗證,行業仍有一條充滿工程挑戰的路要走。 所謂具身智能,指的是能透過物理身體在現實世界中感知、推理並執行任務的人工智慧系統,最典型的載體便是各式機器人。與純粹的語言模型不同,具身智能不僅要處理符號與機率,還必須應對真實環境中不可預測的物理變化,這使得演算法、硬體與數據之間必須形成緊密的協同閉環。然而,截至目前,這三者之間的循環尚未真正打通。多模態感知資料如何與運動控制的即時決策無縫對接,依然是困擾全球研究團隊的核心問題。 從技術發展的歷史座標來看,今天的具身智能處境與 GPT 系列誕生前的自然語言處理領域極為相似。當年業界雖然已經有大量的語言模型與序列生成技術,但直到 GPT-3 乃至 ChatGPT 的出現,才讓大眾和產業真正看到通用語言能力的爆發可能。如今的機器人領域雖然在避障、抓取、導航等單一技能上累積了不少成果,但一旦要將這些能力整合進一個連續的任務流程中,系統的穩定性與泛化性就會出現顯著衰減,而這正是「前 GPT 時代」的典型特徵。 正因如此,今年被業界定義為具身智能的「跑通年」。這個詞的出現意味著整個行業的發展焦點正在轉移:從過去追求單點功能的驚豔表現,轉向驗證系統在有限場景下的基礎可用性。過去幾年,機器人後空翻、精細操作等 demo 層出不窮,但多數仍停留在展示階段,距離實際部署還有遙遠距離。現在,研發團隊更在意的是,能否讓機器人在一個具備明確邊界的場景中,從頭到尾自主完成一個有意義的任務。 「跑通」的具體內涵,包含從穩定行走、精準抓握到簡單決策的一連串能力。舉例來說,一台服務機器人若要完成「從桌面拿起水杯並送到指定位置」這個動作,它必須先穩定移動到桌邊,透過視覺或觸覺辨識出水杯的位置與方向,以適當的力道進行抓取,接著在移動過程中保持物體不滑落,最後在目標點準確釋放。整個流程看似簡單,卻需要感知、定位、運動控制、力回饋與任務規劃等多個模組的即時協作。 目前多數研究團隊正在嘗試打通這個從感知到執行的完整鏈條。不同於過去只優化其中某一環節,現在的系統設計更強調端到端的閉環測試。一旦任務中途出現誤差,系統必須能夠即時感知並修正,而不是中斷或完全依賴遠端人類干預。這對演算法的即時性與硬體的可靠性都提出了極高要求,也使得多模態融合與物理世界互動的工程瓶頸變得更加具體而迫切。 此外,成本與可複製性也是「跑通年」的另一個核心課題。即便能在特定實驗室環境下展現出流暢的任務能力,如果硬體成本高昂、部署流程繁複,依然無法推動產業進入規模化應用的階段。業界普遍認為,唯有在有限場景內實現低成本、可複製的「跑通」,才有可能讓具身智能從摸索期的示範專案,過渡到真正具有商業與社會價值的應用爆發前夜。 某種程度上,當前的「跑通」驗證,與當年語言模型逐步從問答系統走向通用對話助手的路徑類似。並不是等到所有技術點都完美才迎來爆發,而是在某個有限但夠實用的場景中,先讓用戶看見穩定且可複製的價值。一旦這道門被打開,後續的資料累積與模型迭代便會加速滾動,最終推動整個領域跨越到新的階段。 從整個產業的動態觀察,無論是學術界還是新創團隊,都在加速布局具身智能的基礎驗證工作。許多研究不再急於發表驚人的展示影片,而是將精力花在提升任務成功率、降低硬體故障率,以及讓同一套系統能夠在不同環境中複製相同的表現。這種心態上的轉變,正是領域逐漸成熟的跡象。 當然,從「跑通」到真正迎來具身智能的 ChatPGT時刻,依然需要時間。但正如當年沒人能精準預測語言模型會以何種形式引爆一般,業界也無法斷言這個轉折點何時會降臨。唯一可以確定的是,現在每一支在實驗室裡反覆調整參數、打磨任務閉環的團隊,都在為那個尚未到來的突破累積必要的條件。而當足夠多的基礎可用性被驗證之後,具身智能的爆發或許就會悄然降臨。

Related

相關文章

智東西生成式AI

阿里甩出“配音”神器:能調整情緒,還會說方言

阿里旗下的千問大模型推出語音合成工具Qwen-Audio-3.0-TTS,支援情緒調整、方言及多語種,並可透過自然語言指令控制語氣與場景。該模型在第三方評測中獲得語音合成榜單第一,具備高品質的聲音復刻與抗噪能力。

10 分鐘前

關於面壁智能,聊聊我的一些新思考

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

54 分鐘前

Token收費,不再“天經地義”?

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

1 小時前
全天候科技生成式AI

AI眼鏡繼續進化:不只看見,還要辦事

過去兩年,大模型技術加速導入智慧眼鏡,翻譯、拍攝等應用功能密集問世,成為市場主流。然而,隨著這些能力逐漸成為標配,AI眼鏡所面臨的新課題也隨之浮現——業界開始思考,如何讓眼鏡從「看見」進化到「辦事」,真正成為能主動協助用戶完成任務的隨身裝置。

1 小時前

16萬Star的OpenCode徹底重寫:API全部重做、Bun換Node、桌面端遷移Electron

擁有超過 16 萬顆 GitHub 星星、每月活躍開發者高達 750 萬人的開源專案 OpenCode,在 2026 年 7 月正式推出了 2.0 版本。這不僅是一次例行更新,而是從底層架構到使用者體驗的全面翻新。聯合創始人 Dax Raad 在近期受訪時坦言,這是他職業生涯中「第三次才做對」的產品:0 是原型試水,1.x 是市場驗證,而 2.0 則是在徹底理解整個領域後,從零開始的推倒重來。 這次重寫的核心變革之一,就是完全重構了應用程式介面(API)。

1 小時前