輕量視覺語言動作模型面世
重點摘要
近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。
近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。為了解決這個問題,來自韓國的研究團隊提出了一款名為 CoTinyVLA 的全新模型,僅以不到十億參數的規模,便在業界公認的 LIBERO-Plus 強健性基準測試中創下多項最佳紀錄。
CoTinyVLA 的核心思路並非單純擴大模型尺寸,而是透過結構化的監督方式來提升強健性。這款模型僅有 0.9B 參數,骨幹採用 Qwen3.5-0.8B,卻能在各項考驗中超越參數量比自己大上數倍的對手。研究團隊設計了三項關鍵技術,分別針對不同層面的難題:雙視角時間輸入、層級式思維鏈蒸餾,以及指令同義擴增。在雙視角時間輸入部分,CoTinyVLA 在每一步動作中同時納入兩個攝影機視角的畫面,並對每個視角保留過去 16 幀歷史影像,同時在文字層面加入攝影機標記與時間戳記,讓模型能充分掌握空間與時間脈絡。
層級式思維鏈蒸餾則是從一個擁有 350 億參數的大型教師模型中,將高階的規劃能力提取出來,並轉化為「情節計畫」與「片段思考」兩個層次。前者涵蓋整個任務的階段性規劃,後者則聚焦於當前步驟的動作狀態、夾爪狀態以及下一步子動作,使模型在推理時能像人類一樣逐步思考。指令同義擴增則將原本僅 40 條的基礎指令,透過同義詞與句式變化擴展為 800 種不同表述,大幅提升模型對語言變異的容忍度。這套設計在 LIBERO-Plus 基準測試上展現了驚人的效果。LIBERO-Plus 涵蓋 10,030 個經過擾動的任務,橫跨空間、物體、目標與長期四種維度,以及七種不同的擾動類型。
在空間維度上,CoTinyVLA 達到 90.8% 的成功率,物體維度 87.3%,目標維度 86.6%,長期維度 80.7%,全面領先當時最強的 7B 參數基準模型,分別高出 4.7、2.8、15.9 與 3.0 個百分點,且所有差距的區間都不包含零,顯示統計上的顯著性。尤其值得關注的是,在 LIBERO-Plus 中最困難的「機器人初始狀態」擾動軸線上,CoTinyVLA 的表現格外突出。該軸線測試機器人從不同起始位置執行任務的能力,以往所有已發表的基準模型在任一測試套件中,最高成功率僅有 53.2%。CoTinyVLA 則在目標維度上達到 73.
6%,而最強的 7B 基準模型在同一測試中僅有 39.9%,差距高達 33.7 個百分點。這說明結構化監督不僅讓模型在一般情況下表現穩定,更能在極端變異的環境中維持高水準的執行能力。研究團隊也進行了消融實驗,以分析各項技術的貢獻。結果顯示,雙視角時間輸入、層級式思維鏈蒸餾與指令同義擴增三個組件,在不同擾動軸線上的影響是可分離的。例如,在固定的影像處理預算下,如何將幀數分配給兩個攝影機以及時間軸,本身就決定了高達 8.6 個百分點的性能差異。此外,團隊還進行了閉環推理測試,CoTinyVLA 在推理過程中僅需 2.
25 GiB 的 GPU 記憶體,遠低於數十億參數模型的需求,非常適合部署在記憶體受限的嵌入式系統上。為了驗證層級式思維鏈中「情節計畫」的關鍵性,研究人員設計了干預實驗:將模型生成的計畫內容替換為空字串或與當前任務矛盾的錯誤描述,結果任務成功率直接下降 40 到 45 個百分點。這證明了情節計畫並非可有可無的裝飾,而是整個推理過程的承重結構,一旦缺失或錯誤,模型的執行能力便會大幅崩潰。CoTinyVLA 的論文已於 2026 年 7 月 28 日提交至 arXiv,並在 GitHub 上開源相關程式碼。
研究團隊表示,這項成果證明了透過精心設計的監督訊號,不到十億參數的輕量模型也能在具挑戰性的機器人操控任務中超越所有現有方法,為未來在資源受限的邊緣機器人裝置上部署先進 VLA 模型開闢了新的可能性。隨著機器人技術逐漸從實驗室走向真實場景,這類兼顧效能與效率的輕量級模型,將成為推動產業落地的關鍵一環。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。