何夕2077AI Agent

新框架讓智能體深度分析視頻

2026年8月6日 00:00

重點摘要

研究團隊提出Video-DeepResearch框架,將多模態智能體從靜態影像擴展至連續影片,並設計解耦的感知與探索流程,以解決模態偏誤及參數知識洩漏問題。該框架採用監督微調搭配群組相對策略最佳化的兩階段訓練,其35B-A3B模型在自建基準上以64.0%平均準確率超越Claude-4.5-Sonnet、GPT-5等模型,展現優異效能。

站內 AI 整理稿

影片分析一直是多模態人工智慧進軍真實世界時最難跨越的關卡之一。與靜態圖片或文件不同,影片本身是一條連續的時間流,智慧體必須同時掌握畫面上每一幀的空間細節與時間變化,還得在此基礎上展開跨網路檢索與推理。一個好的影片研究助手,不能只是「看過」影片,更要能針對片中脈絡提出問題、查找資料、交叉驗證,甚至完成複雜的多跳推理。這正是最新發表的 Video-DeepResearch(Video-DR)框架所欲解決的核心問題。 這項研究由多所機構與學者共同參與,主要作者包括 Zhen Fang、Yu Zeng、Wenxuan Huang、Yiming Zhao、Shiting Huang、Tianfei Ren 等人,並已將程式碼公開於 GitHub。研究團隊在論文中明確點出,過去多模態智慧體多半停留在靜態影像或文字文件的理解,一旦輸入變成整段影片,現有模型便會出現兩大致命弱點,嚴重限制其實用性與可信度。 首先是「模態偏差」。研究團隊發現,許多模型在面對影片任務時,會不自覺地繞過視覺工具,直接改用文字搜尋來找答案。舉例來說,當問題涉及影片中的物件位置或動作順序時,模型寧可仰賴網頁上的文字描述,也不願真正逐幀檢視影片內容。這種行為看似聰明,實際上卻讓視覺理解淪為虛設,也讓模型失去處理長影片真實動態變化的能力。 第二個問題則是「參數化知識洩漏」。這是指模型過度依賴內部記憶中既有的知識,而非透過工具輔助進行真正的分析。當模型被問到影片中發生的具體事件時,它可能從訓練資料中「猜」出一個看似合理的答案,但這個答案未必與影片實際內容相符。這種狀況在面對冷門題材、即時事件或高度專業的影片內容時尤其危險,因為模型根本沒有足夠的知識可以倚靠,卻仍舊硬著頭皮作答。 為了解決上述兩大瓶頸,Video-DR 提出了一套「解耦的感知—探索」流程。概念上非常明確:先看、再找。系統會強制智慧體在進行任何網路檢索之前,先完成徹底的跨幀視覺定位,也就是真正把影片每一幀的關鍵資訊都釘選出來,建立完整的空間與時間座標之後,才允許進入下一步的開放式網路探索。這種分階段的工具解鎖機制,從結構上就杜絕了模態偏差的發生,讓視覺理解不再是可有可無的選項。 在訓練策略上,研究團隊也採用了兩階段設計。第一階段先進行監督式微調,讓模型學會基本的多模態對齊與任務執行能力;第二階段則導入群組相對策略最佳化(GRPO),透過強化學習的方式讓智慧體在探索過程中自行發現工具使用模式,而非只是模仿訓練資料中的行為。研究團隊指出,這種做法能讓模型突破模仿學習的天花板,真正發展出自主探索與決策的能力,也讓框架在不同模型規模下都具有可遷移性。 為了驗證 Video-DR 的成效,研究團隊另外建構了一個名為 Video-DR-Bench 的評測基準。這個基準採用人類與 AI 協作的方式製作,總共包含 200 道高複雜度的多跳視覺問答題目。這些題目設計的關鍵在於,答案無法靠模型內部的參數記憶直接取得,必須真正透過影片理解與外部檢索才能完成,也因此被視為檢驗下一代多模態研究智慧體的試金石。 實驗結果顯示,Video-DR 框架表現相當亮眼。旗艦模型 Video-DeepResearch-35B-A3B 拿下平均正確率 64.0%,一舉超越封閉商業模型 Claude-4.5-Sonnet 的 59.0%,領先幅度達 5.0 個百分點;與 GPT-5 的 52.5% 及 Gemini 2.5 Pro 的 57.5% 相比,優勢更為明顯。值得注意的是,較小規模的 30B-A3B 變體也達到 59.3% 的正確率,與 Claude-4.5-Sonnet 相當,證明這套訓練範式即使在參數規模縮減的情況下依然有效。 從架構上來看,Video-DR 的核心設計可以歸納為三大支柱:第一是解耦的感知到探索流程,搭配分階段工具解鎖,讓系統先專注於視覺理解再進行搜尋;第二是可擴展的影片接地資料引擎,能夠自動產生高品質的多跳問答資料,且這些資料無法靠模型的記憶偷吃步;第三則是前述的 SFT 到 GRPO 兩階段訓練策略,讓智慧體從模仿走向真正的自主學習。 這套框架的意義不僅在於單一模型的性能提升,更重要的是它提供了一個通用的藍圖,適用於不同規模的模型與不同類型的影片內容。研究團隊在專案說明中強調,Video-DR 的目標是邁向「串流深度研究」的願景,也就是讓智慧體在觀看影片的同時,就能夠持續地理解、檢索、推理,最終達成「看得見一切」的視覺原生研究能力。這對於未來的新聞查證、學術研究、影片內容分析、自動化報告生成等應用場景,都具有相當深遠的潛力。 目前研究團隊已將 Video-DR 的程式碼公開在 GitHub 上,提供學術界與開發者進一步使用與改進。隨著多模態模型持續往長影片、即時串流與視覺原生方向演進,這類強調「先看後查」的研究框架,勢必成為下一代人工智慧智慧體發展的重要參考。

Related

相關文章

AI幫你下單,誰在違法?亞馬遜對Perplexity禁令出現“反轉”

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦浙江最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作AI幫你下單,誰在違法?亞馬遜對Perplexity禁令出現“反轉”互聯網法律評論·2026年08月06日 13:13亞馬遜訴Perplexity案上訴改判,重塑AI合規邏輯 2026年8月4日,第九巡迴上訴法院發佈了一份21頁的判決書,撤銷了亞馬遜對Perplexity的初步禁令。 該法院認定,由於是用戶(而非Perplexity)使用AI助手作為人工智能工具訪問了亞馬遜,因此,亞馬遜在本案中並不像地區法院認定那麼更有勝訴的可能,反而是Perplexity擁有更多的有利條件。 基於此,地區法院不應當簽發那份“初步禁令”,以此阻止Perplexity在亞馬遜上被用戶使用。 但這絕不是“Perplexity完勝亞馬遜”的簡單故事。我們需要深究的是:為什麼第九巡迴會推翻地區法院的禁令?這個“不同意”,將如何決定案件發回後的走向,又將如何重塑AI智能體行業的合規邏輯? 一、兩份裁定的本質分歧:從"授權"之爭到"訪問者"是誰 美國地區法院3月9日簽發初步禁令的邏輯支點,是“雙重授權”——用戶授權不等於平臺授權,亞馬遜通過律師函撤銷許可後,Perplexity即通過Comet瀏覽器“在用戶許可但無亞馬遜授權下訪問了密碼保護賬

剛剛
AIBaseAI Agent

AI搜索成電商增長新引擎:Shopify稱其正驅動更多流量與銷售,並未取代傳統谷歌

AI資訊AI新閒資訊正文AI搜索成電商增長新引擎:Shopify稱其正驅動更多流量與銷售,並未取代傳統谷歌發布於AI新閒資訊時間 :Aug 6, 2026閱讀 :1分鐘在人工智能普遍被認為正在衝擊傳統網絡出版、導致廣告及點擊率下滑的背景下,電商軟件巨頭Shopify卻交出了一份截然不同的答卷。

1 小時前7300
何夕2077AI Agent

電商智能體評測基準發佈

電商智能體評測基準發佈。 學者推出面向長期決策的仿真測試庫。他們 ��� 跟蹤了八款主流大模型的表現。詳細指標參考 電商智能體長期測試集 詳情。結果表明長程一致性仍是巨大瓶頸。模型與人類的差距 (´・_・`) 依舊明顯。

5 小時前
何夕2077AI Agent

Cloudflare開源遠程控制工具

Cloudflare開源遠程控制工具。 開發者常面臨智能代理缺少運行環境痛點。該項目 ��� 允許智能體在沙箱中操作電腦。項目在 控制沙箱電腦開源項目 獲得 [2.9k] 關注。該技術大大降低了自動化部署的門檻。整個使用起來 (✿◡‿◡) 十分方便。

5 小時前
何夕2077AI Agent

loopx為長任務提供狀態內核

loopx為長任務提供狀態內核。 智能體執行長任務時容易丟失歷史數據。內核 ��� 能夠妥善保存目標與各種證據。源碼已在 智能代理長任務狀態內核 獲得 [2.1k] 關注。新系統可與多種主流編碼代理兼容。任務交接過程 (o^^o) 更加穩定安全。

5 小時前
MarkTechPost AIAI Agent

Meta AI 推出 Muse Code(Beta 版):由全新 Muse Spark 1.2 模型驅動的終端編碼代理

Meta AI 已發布 Muse Code(Beta 版),這是一款基於全新 Muse Spark 1.2 模型的終端編碼代理。Meta 將此組合定位為邁向技術前沿的下一步,未來還將推出更大規模的模型。Muse Code 專注於大型程式碼庫中的複雜軟體工程:它能夠規劃變更、編寫程式碼並驗證結果。一組非同步背景代理會在整個工作階段中保持活躍,而非每次任務重新生成。本機僅允許附加的事件日誌會記錄每次模型呼叫、工具執行、核准與編輯,Meta 稱其可精確重播且重啟安全。Muse Spark 1.2 是與該 harness 共同訓練的。Meta 還發布了一個核心優化案例研究,在長達 24 小時內執行超過 1,000 次工具呼叫。是否可部署?是的。Muse Code 以 Beta 版形式提供給 macOS 和 Linux 使用者,透過 vi 下載。

9 小時前