何夕2077研究與前沿

輕量視覺語言動作模型面世

2026年7月30日 00:00

重點摘要

近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。

站內 AI 整理稿

近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。為了解決這個問題,來自韓國的研究團隊提出了一款名為 CoTinyVLA 的全新模型,僅以不到十億參數的規模,便在業界公認的 LIBERO-Plus 強健性基準測試中創下多項最佳紀錄。 CoTinyVLA 的核心思路並非單純擴大模型尺寸,而是透過結構化的監督方式來提升強健性。這款模型僅有 0.9B 參數,骨幹採用 Qwen3.5-0.8B,卻能在各項考驗中超越參數量比自己大上數倍的對手。研究團隊設計了三項關鍵技術,分別針對不同層面的難題:雙視角時間輸入、層級式思維鏈蒸餾,以及指令同義擴增。 在雙視角時間輸入部分,CoTinyVLA 在每一步動作中同時納入兩個攝影機視角的畫面,並對每個視角保留過去 16 幀歷史影像,同時在文字層面加入攝影機標記與時間戳記,讓模型能充分掌握空間與時間脈絡。層級式思維鏈蒸餾則是從一個擁有 350 億參數的大型教師模型中,將高階的規劃能力提取出來,並轉化為「情節計畫」與「片段思考」兩個層次。前者涵蓋整個任務的階段性規劃,後者則聚焦於當前步驟的動作狀態、夾爪狀態以及下一步子動作,使模型在推理時能像人類一樣逐步思考。指令同義擴增則將原本僅 40 條的基礎指令,透過同義詞與句式變化擴展為 800 種不同表述,大幅提升模型對語言變異的容忍度。 這套設計在 LIBERO-Plus 基準測試上展現了驚人的效果。LIBERO-Plus 涵蓋 10,030 個經過擾動的任務,橫跨空間、物體、目標與長期四種維度,以及七種不同的擾動類型。在空間維度上,CoTinyVLA 達到 90.8% 的成功率,物體維度 87.3%,目標維度 86.6%,長期維度 80.7%,全面領先當時最強的 7B 參數基準模型,分別高出 4.7、2.8、15.9 與 3.0 個百分點,且所有差距的區間都不包含零,顯示統計上的顯著性。 尤其值得關注的是,在 LIBERO-Plus 中最困難的「機器人初始狀態」擾動軸線上,CoTinyVLA 的表現格外突出。該軸線測試機器人從不同起始位置執行任務的能力,以往所有已發表的基準模型在任一測試套件中,最高成功率僅有 53.2%。CoTinyVLA 則在目標維度上達到 73.6%,而最強的 7B 基準模型在同一測試中僅有 39.9%,差距高達 33.7 個百分點。這說明結構化監督不僅讓模型在一般情況下表現穩定,更能在極端變異的環境中維持高水準的執行能力。 研究團隊也進行了消融實驗,以分析各項技術的貢獻。結果顯示,雙視角時間輸入、層級式思維鏈蒸餾與指令同義擴增三個組件,在不同擾動軸線上的影響是可分離的。例如,在固定的影像處理預算下,如何將幀數分配給兩個攝影機以及時間軸,本身就決定了高達 8.6 個百分點的性能差異。此外,團隊還進行了閉環推理測試,CoTinyVLA 在推理過程中僅需 2.25 GiB 的 GPU 記憶體,遠低於數十億參數模型的需求,非常適合部署在記憶體受限的嵌入式系統上。 為了驗證層級式思維鏈中「情節計畫」的關鍵性,研究人員設計了干預實驗:將模型生成的計畫內容替換為空字串或與當前任務矛盾的錯誤描述,結果任務成功率直接下降 40 到 45 個百分點。這證明了情節計畫並非可有可無的裝飾,而是整個推理過程的承重結構,一旦缺失或錯誤,模型的執行能力便會大幅崩潰。 CoTinyVLA 的論文已於 2026 年 7 月 28 日提交至 arXiv,並在 GitHub 上開源相關程式碼。研究團隊表示,這項成果證明了透過精心設計的監督訊號,不到十億參數的輕量模型也能在具挑戰性的機器人操控任務中超越所有現有方法,為未來在資源受限的邊緣機器人裝置上部署先進 VLA 模型開闢了新的可能性。隨著機器人技術逐漸從實驗室走向真實場景,這類兼顧效能與效率的輕量級模型,將成為推動產業落地的關鍵一環。

Related

相關文章

這這這…翁荔光速回OpenAI上班了

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 這這這…翁荔光速回OpenAI上班了 Jay 2026-07-30 08:31:19 來源:量子位 6位聯合創始人——只剩2名。

剛剛
何夕2077研究與前沿

通用視頻世界模型開發完成

通用視頻世界模型開發完成 近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。 過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。

4 小時前

比特幣慌了?Mythos 60小時撬開後量子密碼算法

Mythos團隊在60小時內成功破解後量子密碼演算法,引發比特幣長期安全性疑慮。比特幣的橢圓曲線數位簽章演算法對量子電腦脆弱,業界呼籲盡快導入抗量子簽章方案。儘管目前無立即危險,但這項突破已為密碼學領域敲響警鐘。

8 小時前

誰在爭奪“具身大腦”?

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

10 小時前

李飛飛出手!用世界模型訓練機器人,五種真機跑一小時不出錯

李飛飛團隊近期提出以世界模型訓練機器人的新方法,成功在五種不同真實機器人上進行測試,並達成連續運行一小時不出錯的穩健表現。這項成果顯示,透過世界模型的模擬與預測能力,能有效提升機器人在真實環境中的適應與執行任務的可靠度。 根據智東西的報導,該研究已在多種硬體平台上驗證,涵蓋不同形態的機器人,且長時間運作未發生失誤,展現世界模型在機器人領域的實用潛力。

14 小時前