IJCAI 2026 專訪:動作指揮計算,VLA 加速不降準 | GAIR Paper 125

2026年8月26日 06:09
站內 AI 整理稿

將動作從輸出端搬到調度端,推理速度提升1.79倍。作者丨鄧哲敏 編輯丨齊鋮湧 機器人想要真正走進千行百業、千家萬戶,有一道繞不開的坎:它得足夠快。不說快到能打羽毛球那,至少得快到讓人覺得這玩意兒能用。一個機械臂每動一下都要停頓兩三秒,哪怕成功率再高,在工業場景裡算下來的投入產出比也很難說服人。VLA 模型是當前具身智能領域最受關注的技術路線之一。它把視覺感知、語言理解和動作生成整合進一套模型,讓機器人能夠依據語言指令完成複雜操作任務。但 VLA 模型有一個部署層面的老大難問題:推理太慢。

每個控制時刻,模型都要把一個龐大的視覺語言骨幹網絡跑一遍,計算量極大,導致延遲居高不下,實時控制頻率難以保證。這個問題並不新鮮,學界已經有不少人在嘗試解決。今年 IJCAI 收錄的一篇論文認為,現有的大多數方案都走偏了一步。AI科技評論(公眾號)聯繫到一作於聞達,圍繞高效 VLA 方法進行交流。論文原文:https://arxiv.org/abs/2601.1963401大家都在剪視覺,但問題真的在這兒嗎現有的高效 VLA 方法,主流路線是在視覺側做文章,剪掉“不重要”的視覺 token,跳過一些 Transformer 層,或者直接複用上一幀的計算結果。

邏輯上聽起來合理:視覺信息最佔計算,減掉多餘的視覺計算,自然就快了。但這裡有一個被忽視的矛盾。在機械臂執行任務的過程中,視覺上的複雜程度和操作上需要的精度,並不總是同步的。機械臂接近目標的階段,畫面可能非常簡單,但這時候恰好需要全力計算,因為精細的夾取動作容不得誤差;反過來,大幅移動階段畫面變化激烈,但其實不需要太多計算資源。換句話說,視覺複雜度不等於控制難度。以視覺信號來決定這一幀算多少,天然就抓錯了對象。

AC²-VLA 一作於聞達告訴AI科技評論(公眾號),團隊在調研文獻時發現了這個矛盾,並意識到 VLA 模型閉環控制過程中,真正能反映當前時刻需要多少計算的,是機器人的動作狀態,而不是視覺畫面。這個判斷很直觀,和 VLA 的邏輯也很吻合——V是視覺,L是語言,A是動作,既然VLA的最終產出是動作序列,那用動作來指導計算分配,才是真正貼近這類模型本質的做法。基於這個出發點,他們提出了 AC²-VLA,全稱是Action-Context-Aware Adaptive Computation for VLA models,即動作上下文感知的自適應計算框架。

兩個 AC,一個代表Action Context(動作上下文),一個代表Adaptive Computation(自適應計算),名字裡藏著雙關。02讓動作來“拍板”AC²-VLA 的框架主圖展示了整體架構:視覺觀測經過視覺編碼器,語言指令經過 embedding,加上上一時刻的動作信息,三者共同構成一個動作先驗條件向量,輸入進一個統一的路由器(router)。這個 router 的輸出,決定了當前時刻的計算策略。

具體來說,router控制三件事:▎一、cognition caching(認知緩存複用)如果當前動作狀態比較穩定,router 認為可以嘗試複用上一步的 VLM 骨幹網絡輸出,就會發起復用請求。但這個請求不等於直接複用,還需要看緩存是否能命中,綜合判斷運動狀態是否連續、視覺狀態是否匹配。兩個條件都滿足,才會跳過整個 VLM 骨幹的計算,直接將緩存中的特徵向量送入 action head 生成動作序列。▎二、token pruning(視覺token剪枝)router 會為每個視覺 token 打分,判斷它與當前操作階段的相關程度。不相關的 token 被直接丟掉,縮短序列長度,減少計算量。

這一步的依據同樣來自動作上下文,機械臂正在接近夾取目標時,夾爪附近區域的 token 更重要;大範圍移動時,這些區域的權重會相對下降。▎三、layer skipping(層跳過)並非每一層 Transformer 都需要每次執行。router 根據動作上下文判斷當前需要多深的計算,對不需要的層直接跳過。有意思的是,不同任務階段跳過的不一定是同樣的層,同樣保留28層,接觸階段和移動階段調用的層序號可能完全不同,模型學會了在不同階段調用最合適的網絡深度。這三個機制由同一個 router 統一調度,而不是各自用不同的啟發式規則來判斷。

這也是 AC²-VLA 和此前工作最核心的區別之一,之前的方法即使有類似的機制,也往往相互獨立,沒有統一的訓練過的路由來智能分配。03自蒸餾,一個很關鍵的訓練設計Router 的訓練方式值得單獨解釋。自然會有人想到,為什麼不直接用任務成功率來監督 router 的學習?讓它學會成功率高的時候可以少算,成功率低的時候多算?問題在於,任務成功率是一個非常稀疏、非常離散的信號,而且只有完整跑完任務才能知道結果,沒有辦法實時反饋到每個時間步的計算決策上。更重要的是,如果以成功率為優化目標,框架的泛化性就會受損,換一個 backbone,成功率分佈完全不同,原來學到的計算策略就失效了。

AC²-VLA 的解法是自蒸餾(self-distillation):用稠密策略(dense policy,即原始未稀疏化的模型)作為teacher,讓稀疏化之後的 student 模型去模仿 teacher 的動作輸出和骨幹網絡特徵表示。稠密模型已經在 Open X-Embodiment 數據集上訓練過,對這些任務有一定的成功能力,用它作為 teacher,就能在儘量少算的約束下,讓稀疏策略保持接近稠密策略的表現。這個設計讓 AC²-VLA 的高效框架有了可遷移性,換一個 VLA 骨幹,只需要重新走一遍蒸餾流程,不需要為每個任務單獨調參。

04推理速度快了多少AC²-VLA 基於 CogACT 構建,在 SIMPLER 仿真基準上進行了評測。SIMPLER 是當前具身智能領域常用的高保真仿真基準,旨在縮小真實世界與仿真的遷移差距。在 Google Robot 的 Visual Matching 設定下,AC²-VLA 在四個任務上的平均成功率達到 76.8%,超過稠密基線 CogACT 的 74.8%,也超過了 RT-2-X 的 46.3%。其中 Drawer Opening 任務的成功率從 71.8% 提升到 80.6%,幅度最為明顯。效率數據更直觀:計算量降低到原始模型的29.4%(FLOPs),實際推理速度提升 1.

79 倍。這個 1.79 倍,在論文發表時是同類方法中的當前最優水平。值得注意的是,這個加速並沒有帶來成功率的下降,反而略有提升。論文的解釋是,被去掉的那部分計算大量對應於干擾項和冗餘特徵,移除它們反而讓模型的決策更穩定。FLOPs 降到 29.4% 而實際速度只提升 1.79 倍,兩者之間的差距,於聞達解釋為理論計算量與實際運行之間不可避免的開銷:router 本身的運算、token 剪枝時的內存移動、緩存的查詢和命中過程,這些都不完全體現在 FLOPs 裡,但在實際運行時都會佔用時間。因此,實際端到端加速才是更真實的參考指標。消融實驗進一步驗證了三個組件各自的必要性。

去掉緩存複用,成功率下降到 70.5%,速度也從 1.79 倍降到 1.66 倍;去掉層跳過,成功率跌至 67.4%;去掉 token 剪枝,速度降至 1.52 倍。三軸同時啟用,才能達到最優的速度-精度平衡。還有一個有趣的發現:在合適的緩存閾值設定下(τcache = 0.2),緩存複用不僅帶來速度提升,還把成功率推到了 87.1%,超過稠密基線 12.3 個百分點。論文將這個意外收益歸因於時間一致性——逐幀推理容易放大高頻視覺噪聲,導致動作抖動;而在動作上下文穩定時複用特徵,相當於給決策過程加了一層平滑,反而讓控制更穩。

05這套框架的意義從論文本身看,AC²-VLA 解決的是一個具體的工程問題:讓 VLA 模型在不大幅犧牲成功率的前提下,快到可以用。但它背後有一個更值得關注的思路轉變——把動作從“模型輸出”變成“模型計算的調度信號”。之前的高效 VLA 工作,把動作當做需要被輸出的結果;AC²-VLA 第一次嘗試讓動作反過來指導模型該看哪裡、該想多少、哪些東西可以複用。於聞達提到,這個思路其實和 VLA 模型自身的邏輯一脈相承——既然動作是終點,那用動作上下文來規劃通往終點的路徑,順理成章。

團隊後續還有一篇工作(Actfovea,尚未發表)沿著相同的邏輯延伸,把動作作為先驗信號,往安全性和魯棒性的方向探索:如果動作序列和視覺狀態之間出現了不一致,這種不一致本身就可以用來判斷當前的觀測和動作是否可信,以及是否需要回退重計算。從落地的角度看,這類工作的現實意義更直接。當前 VLA 模型的部署難點,並不總是模型不夠強,更多時候是模型太慢、太重,跑不起來。邊緣設備沒有足夠的顯存,機器人沒有足夠的算力,工廠裡的機器臂不能等上三秒才動。把一個 7B 量級的 VLA 模型壓縮到可以在端側穩定運行,是讓它從實驗室走向車間的必要一步。IJCAI 2026 要來了,你還在單打獨鬥?

為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。

現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

何夕2077研究與前沿

SPADE自博弈環境生成

SPADE透過自博弈機制讓大型語言模型生成可執行的環境,並由同一模型分別扮演不同角色。環境目標會隨著模型能力提升而自動調整難度,最終使工具使用能力提升13.9%。

7 小時前

世界模型離通用還有多遠?

TechPulse2026.08.25 12:06 · 來自河北全文1711字00:00 / 05:05通用世界模型不是單一的生成器、模擬器、機器人動作模型或策略模型,也不是這些能力的割裂片段或簡單線性串聯,而是三種能力耦合在一起的閉環反饋系統。

19 小時前

具身大滿貫還全開源!原力靈機DM0.5登頂RoboDojo,且clone且珍惜

原力靈機的具身模型DM0.5在RoboDojo評測中奪冠,綜合得分24.90,平均成功率19.34%,並在記憶維度表現突出。該模型在LIBERO、RoboTwin 2.0等多項評測中皆取得佳績,且已全面開源。模型透過長記憶、具身思維鏈與對齊式動作監督等創新,並將核心延遲大幅降低至57.49毫秒,旨在以開源賦能產業生態。

20 小時前

WRC 2026|生數科技發佈最新研究成果,提出通用世界模型五級發展路線

WRC 2026 期間,生數科技發表最新研究成果,正式提出通用世界模型的五級發展路線。這項研究以階段化架構界定通用世界模型的能力演進,為該領域提供一套可供對照的技術框架。 生數科技此次發布的五級路線,將通用世界模型的發展劃分為依序推進的多個層級,每一層級對應不同的技術課題與能力範疇,共同構成完整的發展藍圖。透過明確的階段劃分,這項成果有助於外界更清楚地理解通用世界模型的發展脈絡,也具體反映出生數科技在該領域的持續投入。 相關成果已在 WRC 2026 期間對外公開,關於五級路線的具體內涵與後續研究規劃,仍有待生數科技進一步揭露。

21 小時前

高盛合夥人警告:華爾街普及 AI 或削弱金融從業者思考能力

作者:遠洋 責編:遠洋 評論: 8 月 25 日消息,高盛負責一項旗艦人工智能項目的合夥人警告稱,AI 在華爾街的快速普及可能削弱下一代金融從業者的思考能力。“這裡存在一個巨大的風險:在 AI 時代,我們把推理能力外包給這些模型,最終出現認知能力萎縮,以至於我們自己都無法再從第一性原理出發進行思考。

22 小時前

李飛飛押注的空間智能:生成的世界,如何「經得起折騰」?

AI 生成的大多數世界“中看不中用”,根本原因是 AI 少了一本“底賬”:一份記住世界裡有什麼、每次行動改變了什麼、並且能被檢查和回滾的狀態記錄。作者丨劉紫東 編輯丨幸麗娟 李飛飛押注的空間智能,被視為世界模型的主流路線之一。這條路線的基本構想是,讓 AI 從識別二維畫面,走向理解、推理和生成可進入、可操作、可持續編輯的三維世界。

1 天前