谷歌機器人整了波大活兒,要攻克「最後幾釐米」的行業難題?

重點摘要
Google DeepMind推出Gemini Robotics 2,主打「全身智能」的機器人通用模型,強調同時協調雙腿、軀幹、雙臂與手指,並搭配負責高層規劃的ER 2與可快速適應新本體的On-Device 2。官方展示機器人能自主彎腰撿水壺、從貨架取物及使用五指靈巧手執行擰燈泡、封自封袋等精細操作,但地面取物與多指靈巧任務成功率仍偏低。整體而言,谷歌試圖讓機器人模型跨越過去只控制上半身的限制,但距離穩定進入家庭與工廠仍有距離。
谷歌機器人部門最近丟出了一顆震撼彈。在 WAIC 2026 落幕後不久,Google DeepMind 正式發表 Gemini Robotics 2,這套被稱為「全身智能」的通用機器人模型,試圖解決當前機器人產業最棘手的難題:不是讓機器人學會走路或揮手,而是讓它具備真正協調全身的能力,去完成那些需要同時動用雙腿、軀幹與手指的複雜任務。換句話說,這套系統要挑戰的,正是從「機器人會動」到「機器人會幹活」之間,那最後一哩路的鴻溝。 回顧先前在上海舉行的 WAIC 2026,現場超過兩百家機器人企業、三百多台真機同台較勁,熱鬧非凡。從宇樹科技三米高的載人變形機甲,到智元機器人用鑷子夾起兩毫米電阻焊接電路板,各家廠商展現的不只是機械動作的流暢,更想證明機器人已具備實際作業的能力。然而,業界普遍認知到,打造一副能跑能跳的「身體」早已不是最稀缺的技術,真正的瓶頸在於「大腦」——如何讓機器人在混亂的真實環境中看懂眼前景象、判斷下一步動作,並將決策即時且穩定地傳送到數十個關節的協同運作。 Google DeepMind 此次發佈的 Gemini Robotics 2,核心概念正是「全身智能」。過去我們看到許多機器人示範,往往帶著濃厚的「回合制」遊戲感:機器人先走到桌邊、停穩,然後才伸出機械臂抓取物品;完成任務後,又得切換另一套行走控制器,才能移往下一站。這種模組分工的做法固然務實,但只要桌子位置偏了一點、物體稍微滑動,或是必須邊走邊維持抓握,不同模組之間的銜接就會出現明顯破綻。 Gemini Robotics 2 的突破,在於它讓機器人不再「先站好再伸手」。從官方釋出的影片可以看到,搭載這套模型的 Apptronik Apollo 2 機器人走向放置在地上的綠色水壺,彎腰直接將它提起;接著又走向貨架,取出一隻棒球手套後轉身離開。這些動作看似平常,背後卻同時牽涉視野判斷、手臂可達範圍、步態調整與重心平衡。當手臂伸得更遠,身體就必須跟著前傾;身體前傾的同時,雙腿也得即時做出補償,整套動作是連續且相互耦合的,並非獨立模組的簡單組合。 這正是「全身」一詞的實際含義。Gemini Robotics 2 不再把雙腿視為純粹的運輸工具、把雙手當作獨立作業工具,而是將整副身體視為一個統一協調的動作空間。Google 表示,同一個模型已成功用於搭載不同靈巧手的 Apollo 2 機器人,以及使用兩指夾爪的 Franka Duo 機器人,顯示其企圖心並不僅限於打造某一款人形機器人的專屬大腦,而是朝更通用的方向邁進。 不過,Google 也誠實面對當前的技術限制。官方測試數據顯示,Apollo 2 從桌面、地面與貨架取物的平均成功率分別為 68.4%、45.7% 與 76.3%。最能體現全身控制能力的地面取物,恰好也是失敗率最高的一項,機器人走路、下蹲與擺放物品的速度也明顯偏慢,Google 承認移動速度仍是未來需要持續改善的環節。 除了全身控制,另一個備受關注的焦點在於機器人作業的「最後幾釐米」。影片中,Apollo 2 使用一隻擁有 22 個自由度的五指 SharpaWave 靈巧手,進行擰燈泡、封自封袋、給垃圾袋打結等任務;另一旁的 Franka Duo 則用兩隻夾爪,將形狀各異的工具整齊裝入工具箱。這些任務遠比單純把硬物從 A 點搬到 B 點複雜,涉及連續接觸、雙手配合與物件形變,塑料袋會塌陷、繩結會滑脫、燈泡既要對準螺紋又不能過度施力。Gemini Robotics 2 的目標,正是從視覺與指令直接生成這些高頻連續的動作,跳脫過去「先規劃、再執行」的傳統控制邏輯。 公開的測試成績也頗能說明現況。兩指夾爪在通用抓放、工具配套與精密插入上的平均成功率分別達到 74.2%、78.9% 與 89.6%,表現相對穩定;但換成多指靈巧手,難度立刻飆升——擰下燈泡的成功率達 92%,但擰上燈泡僅有 36%,垃圾袋打結為 44%,使用簸箕與封自封袋更分別只有 32% 與 40%。這組數據顯示,大模型已能接管相當複雜的手部動作,但多指靈巧操作距離「人類級」仍有一段明顯差距,至少現階段機器人擰燈泡仍有相當高的失敗機率。 Gemini Robotics 2 的另一項亮點是多機協作能力。影片中,Apollo 與 Franka Duo 共同整理工具箱,Apollo 負責發出任務指令,Duo 則將工具依序放入盒內。值得注意的是,這兩台機器人各自運行一套模型,透過高層推理進行工作分配與銜接,並非由單一中央神經網絡同時操控兩副身體。ER 2 模型還會持續觀看影片畫面,判斷任務進度、偵測失敗並決定是否重試,這種「像團隊一樣交接任務」的協作模式,與過去機械式執行預設工序的做法截然不同。不過目前展示的只是經過設計的數分鐘收納場景,距離多台機器人連續數月在真實工廠中穩定協作,仍有很長的路要走。 事實上,Google 並未完全揚棄具身智能產業普遍採用的「大腦+小腦」架構。高層推理仍由 ER 2 負責,它具備理解環境、規劃長任務與人機溝通的能力,甚至可將導航 API、機械臂接口或他廠的 VLA 模型當作工具來調用;動作層則由 Gemini Robotics 2 這個 VLA(視覺-語言-動作)模型統一指揮全身關節。第三個模型 On-Device 2 則可離線運行於終端設備,並以少於 200 個樣例、幾小時的數據,快速適配新的機器人本體。這樣的分工有其現實考量:底層控制需要毫秒級響應,高層推理卻可能涉及資料檢索與理解模糊指令,兩者所需算力與運行頻率截然不同,硬塞進一個巨型網絡不僅訓練成本高昂,出錯時也更難追溯問題根源。安全因素同樣關鍵,急停、限速與人機安全距離這類紅線,終究不能只靠端到端學習的概率來保證。 這股「全身智能」的浪潮並非 Google 獨有。Figure 今年初發佈的 Helix 02,同樣將所有傳感器接入一套全身視覺運動策略,讓 System 1 以 200Hz 輸出全身關節目標、System 0 以 1kHz 處理平衡與接觸、System 2 負責語義推理;智元最新的 GO-2 則直接點出「語義—執行鴻溝」的問題,以動作思維鏈與異步雙系統,銜接低頻規劃與高頻執行。同時,Nvidia 開源的 GR00T N1.6 已納入數千小時遙操作數據,支援智元 Genie-1 與宇樹 G1 等不同平台後訓練;Physical Intelligence 的 π0.5 則讓輪式雙臂機器人在陌生住宅中連續打掃廚房與臥室,任務時長達 10 至 15 分鐘;螞蟻靈波開源的 LingBot-VLA 2.0,更以 6 萬小時數據覆蓋 20 種機器人構型,將手臂、靈巧手、腰部、頭部與移動底盤全部映射進統一的動作空間。 從這些發展趨勢可以看出,機器人模型領域正逐漸走向大語言模型早期的競爭樣貌——先以多任務、多本體數據訓練一套通用基礎能力,再花少量數據快速適應具體硬件與場景。若換一副機械臂或一套傳感器就必須重新採集海量數據,所謂通用模型終究難以形成規模效應。但機器人比聊天模型更難應付,因為它必須面對真實世界的種種意外:零件磨損、電量消耗、碰撞衝擊、人類突然闖入,甚至網路中斷。Gemini Robotics 2 的意義,與其說是一顆讓機器人突然開竅的「神級大腦」,不如說是將走路、平衡、精細操作、長任務規劃與多機協作放進同一張考卷的開端。相比過去「一種任務對應一套演算法」的舊思維,這確實是朝正確方向邁進了一大步——至於機器人何時能真正走進一般家庭,彎腰撿起掉落的杯子、順手擦乾灑出的水,甚至在下班回家前把房間收拾整齊,恐怕還得等待更多技術積累與時間驗證。
Related
相關文章

國家超算互聯網上線 DeepSeek-V4-Flash 正式版 API,一鍵接入即可快速調用
首頁 > 智能時代>人工智能 國家超算互聯網上線 DeepSeek-V4-Flash 正式版 API,一鍵接入即可快速調用 2026/8/2 15:39:40 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 8 月 2 日消息,7 月 31 日,DeepSeek 官宣 DeepSeek-V4-Flash 正式版 API 開啟公測。國家超算互聯網正式上線 DeepSeek-V4-Flash 正式版(DeepSeek-V4-Flash-0731)模型 API 調用服務和模型文件。據介紹,DeepSeek-V4-Flash-0731 經過大量後訓練工作,智能體能力大幅增強,指令遵循能力大幅增強。在多項基準測試中,DeepSeek-V4-Flash 正式版性能可與當前最強的閉源模型相媲美。超算互聯網現面向企業和開發者提供 DeepSeek-V4-Flash-0731 模型 API 調用服務,用戶無需繁瑣環境配置,一鍵接入即可快速調用。用戶可登錄國家超算互聯網官網 PC 端,通過首頁「服務」下拉菜單進入「模型服務」專區,一鍵直達模型 API 調用頁面。目前,超算互聯網 AI 社區已累計彙集 1700 餘款國內外熱門開源大模型,覆蓋 DeepSeek、GLM、Qwen、Kimi 等主流系列,全面上線 DeepSeek-V4、MiniMax-M3、Kimi-K3 等多款國產開源大模型 API 接口。IT之家注意到,伴隨核心節點已正式投運,國家超算互聯網已成為全國首個十萬卡級超智融合算力資源池。相關閱讀:《DeepSeek-V4-Flash 正式版 API 上線公測,V4-Pro 正式版將“儘快”發佈》廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。 投訴水文 我要糾錯 下載IT

首屆全國青少年人工智能大賽決賽上海開賽,設 5 大前沿賽道
首頁 > 智能時代>人工智能 首屆全國青少年人工智能大賽決賽上海開賽,設 5 大前沿賽道 2026/8/2 15:31:40 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 8 月 2 日消息,據新華社今日報道,首屆全國青少年人工智能大賽決賽 8 月 1 日在上海開賽。來自全國 31 個省(自治區、直轄市)和新疆生產建設兵團以及香港、澳門特別行政區的 850 餘名選手,從 4.6 萬名參賽者中脫穎而出,在上海進行最終角逐。作為教育部批准的“2025—2028 學年面向中小學生的全國性競賽活動”,首屆全國青少年人工智能大賽由中國福利會和中國婦女發展基金會共同主辦,以“智能向善生長無限”為主題,秉持公益性、規範性、普惠性原則,旨在推動“人工智能 + 教育”深度融合,構建“專才選拔、技能選育、素質培養”相結合的青少年人工智能創新創造平臺、人工智能科學素養培養和知識普及平臺。本次決賽設置人工智能基礎知識大賽、人工智能工具應用大賽、人工智能驅動科學大賽、具身智能大賽、大語言模型應用大賽等 5 大前沿賽道,全面考察選手從認知理解、工具實操到跨學科探究、前沿技術融合的多層級能力。大賽將人工智能普惠作為重要關切,特邀上海對口支援地區和欠發達地區的 60 餘名學生來滬觀摩決賽,並參加青少年人工智能嘉年華等研學活動。IT之家注意到,三天決賽期間,大賽組委會還將舉辦“教研工作坊”“產教研融合工作坊”等主題活動。人工智能領域專家學者、業界人士和中小學校長、教師等,將共同探索青少年人工智能教育新路徑,推進人工智能早期教育和素質普及。廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:上海,人工智能,全國青少年人工智能大

中國 AI 大模型領跑全球榜單,央視詳解背後的優勢所在
OpenRouter 最新一週 AI 大模型調用量榜單中,前五名全由中國企業包辦,小米 MiMo-V2.5 以單週 10.5 萬億 Tokens 居冠,DeepSeek 與騰訊混元也上榜。中國開源模型在 Hugging Face 累計下載量全球第一,專家指出開源策略能降低應用門檻並換取長期生態影響力。榜單未納入企業私有化部署與美國封閉 API 流量,但國產開源模型已在市場化第三方渠道取得領先。

貝索斯用 AI 尋找下一塊硅
亞馬遜創辦人貝索斯旗下投資機構參與英國AI材料公司CuspAI的4.5億美元B輪融資,該公司估值達26億美元,成立不到兩年。CuspAI主打以「逆向設計」用AI生成候選材料結構,並成立AI Materials Foundry,串聯輝達、Meta等超過45家夥伴,企圖打造跨產業的材料研發平台。目前該公司尚無重大商業化成果,但資本看好AI加速新材料發現的潛力。

全球語音大模型,角逐方向盤後的麥克風
全球語音大模型競爭從文本對話框轉向汽車座艙、智慧眼鏡與無線耳機等硬體入口,SpaceXAI、OpenAI、Anthropic、亞馬遜、阿里雲與Google等業者七月接連發布新品,在首音延遲、語音識別精度與成本上展開毫秒級軍備競賽。各廠商技術路線分歧明顯,Grok Voice採原生端到端架構壓低延遲,OpenAI以token計費,Anthropic和亞馬遜走混合路線,阿里雲則在精度登頂但延遲偏高,而微軟與Meta也分別以平台整合及開源模型參與布局。

前 DeepMind 研究員蒂博爆料:谷歌曾在 ChatGPT 發佈一年前做出類似產品,但最終被雪藏
前 DeepMind 研究員蒂博爆料,谷歌早在 ChatGPT 發布一年前就開發出類似聊天機器人產品 LMChat,但因擔心與 Google 搜尋業務競爭而被雪藏。谷歌內部認為該產品並未比搜尋更優,因此最終未推出。