現場直擊:高昂真機成本鎖死具身進化,Google 科學家用視頻世界模型破局|RSS 2026

2026年7月27日 02:30

重點摘要

進群傳送門: 掃碼進群或添加微信Luyoyo_2026,備註:論文群 + 關注的 AI 方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

站內 AI 整理稿

# 現場直擊:高昂真機成本鎖死具身進化,Google 科學家用視頻世界模型破局|RSS 2026

雷峰網 RSS 2026 現場報導

走入 RSS 2026 的展廳,最強烈的感受並非來自於機器人靈巧的抓取動作,而是來自於研究人員臉上那一抹難以掩飾的苦笑。在每一個攤位前,當被問及「為什麼不進行更多真實場景測試?」時,幾乎所有團隊的回答都指向同一個無解的難題:高昂的真機成本。這一現象不僅僅是經費上的拮据,更已成為鎖死具身智能進化之路的核心瓶頸,讓這個充滿希望的領域陷入了一種尷尬的境地。 從機械結構的精密設計、傳感器的高昂造價到執行器的複雜工藝,每一台實體機器人的誕生都意味著數十萬甚至上百萬元的研發與製造成本。對於學術實驗室而言,購置一台像樣的雙臂機器人可能就耗盡了全年預算;對於初創公司來說,大規模部署機器人進行數據採集更是遙不可及的夢想。現場一位來自史丹佛大學的研究員向記者坦言,他們的團隊花了整整一年時間才湊齊資金買下一台測試用機器人,結果在第一次跌倒測試中就把昂貴的關節模組摔壞,整個項目被迫停擺三個月。這樣的故事在 RSS 2026 現場比比皆是,許多研究者直言,這道成本鴻溝已經成為阻礙整個領域從實驗室走向落地的最後一堵牆。 更根本的問題在於,機器人學習需要海量的真實交互數據。與計算機視覺或自然語言處理不同,機器人無法單純依靠網路上的圖片或文字來訓練,它必須在真實物理世界中進行無數次的嘗試與錯誤。每一次抓取、每一步行走、每一個避障動作,都需要耗費大量的時間與金錢。以當今主流的強化學習框架為例,一個從零開始訓練的抓取任務往往需要數百萬次的嘗試,這在虛擬環境中或許只需要幾個小時,但在真實世界中卻意味著數月甚至數年的機械磨損與維護成本。這種「硬體貧窮」的現實,讓許多充滿創意的算法只能在仿真環境中「紙上談兵」,難以在真實世界中驗證與迭代。 然而,正是在這樣的困境之中,Google 科學家團隊在 RSS 2026 上提出了一套令人矚目的破局思路,瞬間成為全場矚目的焦點。他們的核心武器,正是「視頻世界模型」。這不是一個陌生的概念,但 Google 團隊將其應用於具身智能的訓練範式,帶來了革命性的突破。傳統的機器人訓練需要讓機器人在真實環境中反覆試錯,每一次摔倒都會造成硬體磨損,每一次失敗都在消耗成本。但 Google 的方法巧妙地繞過了這一陷阱:他們讓機器人在「腦內」完成絕大部分的策略探索與優化。 具體而言,這個視頻世界模型透過學習海量來自真實世界的交互視頻,能夠在潛在空間中精準地預測物體動態與機器人動作的後果。這個模型不再僅僅是「看」視頻,而是真正「理解」了物理世界的因果關係——它知道當機械臂以某種力度推動一個杯子時,杯子會如何滑動、是否會傾倒、液體會如何灑出。這種預測能力並非來自於預先編寫的物理法則,而是從數百萬小時的真實視頻中自我學習出來的隱含知識。 這項技術的驚人之處在於,它大幅削減了對實體機器人的依賴,將高昂的硬件成本轉化為可擴展的計算成本。研究人員可以在模型構建的虛擬空間中進行大規模的策略搜索與優化,讓智能體在數百萬次「想像」中學會如何避開危險、如何提高效率,而這一切都不需要任何真實機器人的參與。只有在模型訓練已經足夠成熟、策略已經足夠穩健之後,才會將最終結果部署到真實機器人身上進行最後的微調。 現場展示的實驗結果令人震撼。經過視頻世界模型預訓練的機器人,在轉移到真實場景時表現出極高的適應性與魯棒性。在一次演示中,機器人需要處理一組它從未見過的物體——包括形狀不規則的陶瓷茶杯、表面光滑的金屬盤以及質地柔軟的矽膠玩具。傳統訓練下的機器人往往會因為視覺特徵的變化而無所適從,但預訓練後的機器人幾乎是毫不猶豫地完成了所有抓取任務。更令人驚嘆的是,當研究人員刻意改變環境光線、桌面紋理甚至物體的擺放角度時,機器人依然能夠穩定工作,展現出極強的泛化能力。 這不僅僅意味著具身智能的迭代速度將被大幅提升,更預示著未來機器人或許可以像人類一樣,通過觀察與想像來學習技能,而非事事都要親身試錯。回想人類的學習過程,我們不需要親自觸碰火爐才能知道它燙,不需要從懸崖上摔下去才知道高度危險——我們通過觀察他人、通過想像後果就能學到規避風險的知識。Google 團隊的視頻世界模型,正是賦予機器人這種「觀察學習」與「想像推理」的能力,讓機器人從被動的數據採集者轉變為主動的認知建構者。 在技術層面,這一方案還解決了仿真環境中的一個經典難題:「仿真到真實」的鴻溝。傳統的仿真平台無論多麼精細,都無法完全復刻真實世界的物理特性——摩擦力、材料形變、氣流影響等微小因素總會造成預測與現實之間的偏差。但視頻世界模型直接從真實視頻中學習,它的「世界知識」本就是從真實場景中提煉出來的,因此天然避免了仿真與現實之間的脫節問題。這意味著模型在「想像」中所學到的技能,直接可以在真實世界中應用,無需繁瑣的遷移調試。 當然,Google 團隊也坦承,這項技術目前仍處於早期階段。視頻世界模型的訓練需要極大規模的計算資源和數據集,對於資源有限的實驗室來說仍有一定的門檻。此外,模型的泛化能力雖然令人印象深刻,但在面對極端罕見或高度動態的場景時,仍然可能出現預測失誤。如何讓模型在安全範圍內進行探索,如何保證「想像」中的錯誤不會導致真實世界的危險,都是後續研究需要解決的問題。 儘管如此,這項工作無疑為整個領域指出了一個更加輕量級、可規模化的進化路徑。在 RSS 2026 現場,多位與會專家表示,視頻世界模型的出現可能會改寫具身智能的發展節奏。過去,誰擁有最多的機器人、最昂貴的硬體平台,誰就能在數據和實驗上佔據優勢。但在新的範式下,數據處理能力、模型設計水平和計算效率將成為新的競爭焦點。這種轉變有望打破大型科技公司對高端硬體資源的壟斷,讓更多小型團隊也能參與到具身智能的核心研究中來。 從更宏觀的角度來看,這項進展也讓我們重新思考「智能」的本質。如果說具身智能的目標是讓機器人像生物一樣在物理世界中自主行動,那麼 Google 團隊的研究表明,物理經驗的「內化」可能比物理經驗本身更為重要。正如人類不需要經歷所有可能的危險才能學會避險,機器人也不需要經歷所有可能的物理失敗才能學會成功。在這一理念的指導下,未來的機器人或許將不再被視為昂貴的硬體設備,而更像是能夠持續學習、不斷進化的認知主體。 在 RSS 2026 的尾聲,記者再次走過那些展台時,感受到的氣氛已經完全不同。研究人員們的眼神中多了一種久違的光亮——那是看到解決方案時特有的興奮。高昂的真機成本確實曾經鎖死了具身智能的進化之路,但 Google 科學家團隊用視頻世界模型這把鑰匙,正在打開一扇全新的大門。門後的景象雖然模糊,但方向已經清晰:未來的機器人,將不再被成本所困,而是被想像力所解放。 RSS 2026 現場報導,雷峰網記者發自費城。

Related

相關文章

卡帕西闢謠:我沒從Anthropic離職

智東西(公眾號:zhidxcom) 編譯 | 楊京麗 編輯 | 李水青 智東西7月27日消息,昨天,前段時間加入Anthropic的知名AI研究員、OpenAI創始成員安德烈·卡帕西(Andrej Karpathy),對自己已從Anthropic離職的傳聞進行闢謠。面對網友詢問,卡帕西直接否認稱:“這是推特上傳播的奇怪錯誤信息,沒有離職。

剛剛

AI最尷尬的短板,中國科學院出手了

中國科學院近日針對人工智慧領域長期存在的一項被視為「最尷尬的短板」展開研究攻關。這項弱點長期困擾著AI模型的實際應用,尤其在常識推理、因果理解或對抗魯棒性等面向表現明顯,學界與業界多次呼籲需要突破性的解決方案。中科院此次出手,意味著國家級科研機構正式將此議題列為重點方向,試圖從基礎理論或演算法層面彌補當前的技術缺口。

剛剛