谷歌機器人整了波大活兒,要攻克「最後幾釐米」的行業難題?

2026年8月2日 14:44
谷歌機器人整了波大活兒,要攻克「最後幾釐米」的行業難題?

重點摘要

Google DeepMind推出Gemini Robotics 2,主打「全身智能」的機器人通用模型,強調同時協調雙腿、軀幹、雙臂與手指,並搭配負責高層規劃的ER 2與可快速適應新本體的On-Device 2。官方展示機器人能自主彎腰撿水壺、從貨架取物及使用五指靈巧手執行擰燈泡、封自封袋等精細操作,但地面取物與多指靈巧任務成功率仍偏低。整體而言,谷歌試圖讓機器人模型跨越過去只控制上半身的限制,但距離穩定進入家庭與工廠仍有距離。

站內 AI 整理稿

谷歌機器人部門最近丟出了一顆震撼彈。在 WAIC 2026 落幕後不久,Google DeepMind 正式發表 Gemini Robotics 2,這套被稱為「全身智能」的通用機器人模型,試圖解決當前機器人產業最棘手的難題:不是讓機器人學會走路或揮手,而是讓它具備真正協調全身的能力,去完成那些需要同時動用雙腿、軀幹與手指的複雜任務。換句話說,這套系統要挑戰的,正是從「機器人會動」到「機器人會幹活」之間,那最後一哩路的鴻溝。回顧先前在上海舉行的 WAIC 2026,現場超過兩百家機器人企業、三百多台真機同台較勁,熱鬧非凡。

從宇樹科技三米高的載人變形機甲,到智元機器人用鑷子夾起兩毫米電阻焊接電路板,各家廠商展現的不只是機械動作的流暢,更想證明機器人已具備實際作業的能力。然而,業界普遍認知到,打造一副能跑能跳的「身體」早已不是最稀缺的技術,真正的瓶頸在於「大腦」——如何讓機器人在混亂的真實環境中看懂眼前景象、判斷下一步動作,並將決策即時且穩定地傳送到數十個關節的協同運作。Google DeepMind 此次發佈的 Gemini Robotics 2,核心概念正是「全身智能」。

過去我們看到許多機器人示範,往往帶著濃厚的「回合制」遊戲感:機器人先走到桌邊、停穩,然後才伸出機械臂抓取物品;完成任務後,又得切換另一套行走控制器,才能移往下一站。這種模組分工的做法固然務實,但只要桌子位置偏了一點、物體稍微滑動,或是必須邊走邊維持抓握,不同模組之間的銜接就會出現明顯破綻。Gemini Robotics 2 的突破,在於它讓機器人不再「先站好再伸手」。從官方釋出的影片可以看到,搭載這套模型的 Apptronik Apollo 2 機器人走向放置在地上的綠色水壺,彎腰直接將它提起;接著又走向貨架,取出一隻棒球手套後轉身離開。

這些動作看似平常,背後卻同時牽涉視野判斷、手臂可達範圍、步態調整與重心平衡。當手臂伸得更遠,身體就必須跟著前傾;身體前傾的同時,雙腿也得即時做出補償,整套動作是連續且相互耦合的,並非獨立模組的簡單組合。這正是「全身」一詞的實際含義。Gemini Robotics 2 不再把雙腿視為純粹的運輸工具、把雙手當作獨立作業工具,而是將整副身體視為一個統一協調的動作空間。Google 表示,同一個模型已成功用於搭載不同靈巧手的 Apollo 2 機器人,以及使用兩指夾爪的 Franka Duo 機器人,顯示其企圖心並不僅限於打造某一款人形機器人的專屬大腦,而是朝更通用的方向邁進。

不過,Google 也誠實面對當前的技術限制。官方測試數據顯示,Apollo 2 從桌面、地面與貨架取物的平均成功率分別為 68.4%、45.7% 與 76.3%。最能體現全身控制能力的地面取物,恰好也是失敗率最高的一項,機器人走路、下蹲與擺放物品的速度也明顯偏慢,Google 承認移動速度仍是未來需要持續改善的環節。除了全身控制,另一個備受關注的焦點在於機器人作業的「最後幾釐米」。影片中,Apollo 2 使用一隻擁有 22 個自由度的五指 SharpaWave 靈巧手,進行擰燈泡、封自封袋、給垃圾袋打結等任務;另一旁的 Franka Duo 則用兩隻夾爪,將形狀各異的工具整齊裝入工具箱。

這些任務遠比單純把硬物從 A 點搬到 B 點複雜,涉及連續接觸、雙手配合與物件形變,塑料袋會塌陷、繩結會滑脫、燈泡既要對準螺紋又不能過度施力。Gemini Robotics 2 的目標,正是從視覺與指令直接生成這些高頻連續的動作,跳脫過去「先規劃、再執行」的傳統控制邏輯。公開的測試成績也頗能說明現況。兩指夾爪在通用抓放、工具配套與精密插入上的平均成功率分別達到 74.2%、78.9% 與 89.6%,表現相對穩定;但換成多指靈巧手,難度立刻飆升——擰下燈泡的成功率達 92%,但擰上燈泡僅有 36%,垃圾袋打結為 44%,使用簸箕與封自封袋更分別只有 32% 與 40%。

這組數據顯示,大模型已能接管相當複雜的手部動作,但多指靈巧操作距離「人類級」仍有一段明顯差距,至少現階段機器人擰燈泡仍有相當高的失敗機率。Gemini Robotics 2 的另一項亮點是多機協作能力。影片中,Apollo 與 Franka Duo 共同整理工具箱,Apollo 負責發出任務指令,Duo 則將工具依序放入盒內。值得注意的是,這兩台機器人各自運行一套模型,透過高層推理進行工作分配與銜接,並非由單一中央神經網絡同時操控兩副身體。ER 2 模型還會持續觀看影片畫面,判斷任務進度、偵測失敗並決定是否重試,這種「像團隊一樣交接任務」的協作模式,與過去機械式執行預設工序的做法截然不同。

不過目前展示的只是經過設計的數分鐘收納場景,距離多台機器人連續數月在真實工廠中穩定協作,仍有很長的路要走。事實上,Google 並未完全揚棄具身智能產業普遍採用的「大腦+小腦」架構。高層推理仍由 ER 2 負責,它具備理解環境、規劃長任務與人機溝通的能力,甚至可將導航 API、機械臂接口或他廠的 VLA 模型當作工具來調用;動作層則由 Gemini Robotics 2 這個 VLA(視覺-語言-動作)模型統一指揮全身關節。第三個模型 On-Device 2 則可離線運行於終端設備,並以少於 200 個樣例、幾小時的數據,快速適配新的機器人本體。

這樣的分工有其現實考量:底層控制需要毫秒級響應,高層推理卻可能涉及資料檢索與理解模糊指令,兩者所需算力與運行頻率截然不同,硬塞進一個巨型網絡不僅訓練成本高昂,出錯時也更難追溯問題根源。安全因素同樣關鍵,急停、限速與人機安全距離這類紅線,終究不能只靠端到端學習的概率來保證。這股「全身智能」的浪潮並非 Google 獨有。

Figure 今年初發佈的 Helix 02,同樣將所有傳感器接入一套全身視覺運動策略,讓 System 1 以 200Hz 輸出全身關節目標、System 0 以 1kHz 處理平衡與接觸、System 2 負責語義推理;智元最新的 GO-2 則直接點出「語義—執行鴻溝」的問題,以動作思維鏈與異步雙系統,銜接低頻規劃與高頻執行。同時,Nvidia 開源的 GR00T N1.6 已納入數千小時遙操作數據,支援智元 Genie-1 與宇樹 G1 等不同平台後訓練;Physical Intelligence 的 π0.

5 則讓輪式雙臂機器人在陌生住宅中連續打掃廚房與臥室,任務時長達 10 至 15 分鐘;螞蟻靈波開源的 LingBot-VLA 2.0,更以 6 萬小時數據覆蓋 20 種機器人構型,將手臂、靈巧手、腰部、頭部與移動底盤全部映射進統一的動作空間。從這些發展趨勢可以看出,機器人模型領域正逐漸走向大語言模型早期的競爭樣貌——先以多任務、多本體數據訓練一套通用基礎能力,再花少量數據快速適應具體硬件與場景。若換一副機械臂或一套傳感器就必須重新採集海量數據,所謂通用模型終究難以形成規模效應。

但機器人比聊天模型更難應付,因為它必須面對真實世界的種種意外:零件磨損、電量消耗、碰撞衝擊、人類突然闖入,甚至網路中斷。Gemini Robotics 2 的意義,與其說是一顆讓機器人突然開竅的「神級大腦」,不如說是將走路、平衡、精細操作、長任務規劃與多機協作放進同一張考卷的開端。相比過去「一種任務對應一套演算法」的舊思維,這確實是朝正確方向邁進了一大步——至於機器人何時能真正走進一般家庭,彎腰撿起掉落的杯子、順手擦乾灑出的水,甚至在下班回家前把房間收拾整齊,恐怕還得等待更多技術積累與時間驗證。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

48 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前