何夕2077生成式AI

RoboTALES具身智能新框架亮相

2026年7月10日 00:00

重點摘要

加州大學聖地牙哥分校(UCSD)的研究團隊近日發表了一項名為「RoboTALES」的全新框架,旨在解決預訓練影片生成模型在機器人視覺運動控制上的核心痛點——想像軌跡容易偏離任務目標,導致無法穩定地用於規劃或策略學習。該研究已在 arXiv 上公開,同時釋出程式碼與模型,引起機器人學習社群關注。 近年來,預訓練的影片生成模型被視為視覺運動控制極具潛力的骨幹架構。這些模型能夠根據當前觀測想像出未來幾步的畫面,理論上可作為機器人規劃行動的參考。

站內 AI 整理稿

加州大學聖地牙哥分校(UCSD)的研究團隊近日發表了一項名為「RoboTALES」的全新框架,旨在解決預訓練影片生成模型在機器人視覺運動控制上的核心痛點——想像軌跡容易偏離任務目標,導致無法穩定地用於規劃或策略學習。該研究已在 arXiv 上公開,同時釋出程式碼與模型,引起機器人學習社群關注。近年來,預訓練的影片生成模型被視為視覺運動控制極具潛力的骨幹架構。這些模型能夠根據當前觀測想像出未來幾步的畫面,理論上可作為機器人規劃行動的參考。然而,實際應用時模型想像的未來常常與任務意圖產生偏移,而且缺乏與動作條件的可靠連結,使得這類模型難以直接套用在策略提取或閉環規劃上。

為彌補這項差距,研究團隊提出了 RoboTALES,一個能學習任務對齊模擬未來並藉此訓練機器人策略的整合框架。RoboTALES 的核心設計包含兩項關鍵技術。第一項是基於大型語言模型(LLM)的分層規劃器,它能將複雜的長程任務拆解成一連串具體的子目標,進而引導影片生成模型的想像過程,使其不會在時間推進中迷失方向。第二項則是基於視覺語言模型(VLM)的評估機制,這個批評者會檢視模型所「想像」的未來畫面,並透過獎勵形式的回饋信號,讓模型內部表徵持續校準在最終目標上。研究團隊強調,將影片生成器錨定在抽象推理之上,能產出時間上更一致的展開(rollout),以及更連貫的動作序列。

換句話說,機器人不僅能看到合理的未來畫面,還能知道要採取哪些動作才能抵達那裡。這項設計讓 RoboTALES 能同時兼顧模擬品質與策略可用性,跳脫過去必須分兩階段處理的框架。為了驗證效能,研究團隊在 RoboCasa 與 LIBERO10 兩套多樣化的操作任務集上進行測試。結果顯示 RoboTALES 在各種任務上 consistently 優於現有方法,尤其在需要多步驟推理與長時間執行的長程任務中,優勢更為明顯。論文指出,這得益於分層規劃與視覺批評對任務意圖的持續校準,有效減少了想像漂移造成的策略退化。

RoboTALES 的提出正值機器人學界積極探索如何將基礎模型(foundation models)嵌入決策流程之際。過去許多研究嘗試直接將影片生成模型的輸出當作計畫,卻往往因為生成的影片偏離事實或無法對應到具體動作而失敗。RoboTALES 選擇不把影片生成當作終端,而是將其作為可學習的中介表徵,並利用 LLM 與 VLM 的推理能力來監督這個中介表徵的生成過程。值得一提的是,RoboTALES 被定位為單一階段(single-stage)框架,意即影片生成與策略學習並非分開最佳化,而是在同一個訓練流程中彼此強化。這樣的設計不僅簡化了訓練流程,也讓模擬未來與實際動作之間的對齊更為緊密。

研究團隊表示,這種架構在樣本效率與任務泛化上都有正面效益。參與這項研究的成員包括 Hanan Gani、Tejal Kulkarni、Madhoolika Chodavarapu、Nicklas Hansen 與 Manmohan Chandraker。團隊來自加州大學聖地牙哥分校,其中多位成員長期投入視覺推理與機器人學習的交叉領域。此次發表也獲得了 Hugging Face 社群的關注,論文頁面上線不久即獲得社群推薦。RoboTALES 目前已於 GitHub 上公開完整程式碼與預訓練模型,研究人員與開發者可直接下載使用。

論文作者也鼓勵學界在更多真實機器人平台上測試該框架,進一步探索不同感測器輸入與任務類型下的表現。這項工作為結合基礎模型與機器人學習提供了新的實作方向,也為長程操作任務的策略學習帶來了更具可行性的解決方案。隨著機器人應用場景日益複雜,如何讓機器人真正理解任務並在時間軸上保持目標意識,已成為從模擬邁向真實部署的關鍵課題。RoboTALES 將高層語言推理與低層視覺生成加以整合,提供了一個兼顧可解釋性與實用性的新思路。未來若能將這套框架進一步與即時學習或適應性機制結合,可望大幅降低機器人策略對大量示範資料的依賴。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

40 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前