何夕2077AI Agent

新框架讓智能體深度分析視頻

2026年8月6日 00:00

重點摘要

研究團隊提出Video-DeepResearch框架,將多模態智能體從靜態影像擴展至連續影片,並設計解耦的感知與探索流程,以解決模態偏誤及參數知識洩漏問題。該框架採用監督微調搭配群組相對策略最佳化的兩階段訓練,其35B-A3B模型在自建基準上以64.0%平均準確率超越Claude-4.5-Sonnet、GPT-5等模型,展現優異效能。

站內 AI 整理稿

影片分析一直是多模態人工智慧進軍真實世界時最難跨越的關卡之一。與靜態圖片或文件不同,影片本身是一條連續的時間流,智慧體必須同時掌握畫面上每一幀的空間細節與時間變化,還得在此基礎上展開跨網路檢索與推理。一個好的影片研究助手,不能只是「看過」影片,更要能針對片中脈絡提出問題、查找資料、交叉驗證,甚至完成複雜的多跳推理。這正是最新發表的 Video-DeepResearch(Video-DR)框架所欲解決的核心問題。

這項研究由多所機構與學者共同參與,主要作者包括 Zhen Fang、Yu Zeng、Wenxuan Huang、Yiming Zhao、Shiting Huang、Tianfei Ren 等人,並已將程式碼公開於 GitHub。研究團隊在論文中明確點出,過去多模態智慧體多半停留在靜態影像或文字文件的理解,一旦輸入變成整段影片,現有模型便會出現兩大致命弱點,嚴重限制其實用性與可信度。首先是「模態偏差」。研究團隊發現,許多模型在面對影片任務時,會不自覺地繞過視覺工具,直接改用文字搜尋來找答案。

舉例來說,當問題涉及影片中的物件位置或動作順序時,模型寧可仰賴網頁上的文字描述,也不願真正逐幀檢視影片內容。這種行為看似聰明,實際上卻讓視覺理解淪為虛設,也讓模型失去處理長影片真實動態變化的能力。第二個問題則是「參數化知識洩漏」。這是指模型過度依賴內部記憶中既有的知識,而非透過工具輔助進行真正的分析。當模型被問到影片中發生的具體事件時,它可能從訓練資料中「猜」出一個看似合理的答案,但這個答案未必與影片實際內容相符。這種狀況在面對冷門題材、即時事件或高度專業的影片內容時尤其危險,因為模型根本沒有足夠的知識可以倚靠,卻仍舊硬著頭皮作答。

為了解決上述兩大瓶頸,Video-DR 提出了一套「解耦的感知—探索」流程。概念上非常明確:先看、再找。系統會強制智慧體在進行任何網路檢索之前,先完成徹底的跨幀視覺定位,也就是真正把影片每一幀的關鍵資訊都釘選出來,建立完整的空間與時間座標之後,才允許進入下一步的開放式網路探索。這種分階段的工具解鎖機制,從結構上就杜絕了模態偏差的發生,讓視覺理解不再是可有可無的選項。在訓練策略上,研究團隊也採用了兩階段設計。

第一階段先進行監督式微調,讓模型學會基本的多模態對齊與任務執行能力;第二階段則導入群組相對策略最佳化(GRPO),透過強化學習的方式讓智慧體在探索過程中自行發現工具使用模式,而非只是模仿訓練資料中的行為。研究團隊指出,這種做法能讓模型突破模仿學習的天花板,真正發展出自主探索與決策的能力,也讓框架在不同模型規模下都具有可遷移性。為了驗證 Video-DR 的成效,研究團隊另外建構了一個名為 Video-DR-Bench 的評測基準。這個基準採用人類與 AI 協作的方式製作,總共包含 200 道高複雜度的多跳視覺問答題目。

這些題目設計的關鍵在於,答案無法靠模型內部的參數記憶直接取得,必須真正透過影片理解與外部檢索才能完成,也因此被視為檢驗下一代多模態研究智慧體的試金石。實驗結果顯示,Video-DR 框架表現相當亮眼。旗艦模型 Video-DeepResearch-35B-A3B 拿下平均正確率 64.0%,一舉超越封閉商業模型 Claude-4.5-Sonnet 的 59.0%,領先幅度達 5.0 個百分點;與 GPT-5 的 52.5% 及 Gemini 2.5 Pro 的 57.5% 相比,優勢更為明顯。值得注意的是,較小規模的 30B-A3B 變體也達到 59.3% 的正確率,與 Claude-4.

5-Sonnet 相當,證明這套訓練範式即使在參數規模縮減的情況下依然有效。從架構上來看,Video-DR 的核心設計可以歸納為三大支柱:第一是解耦的感知到探索流程,搭配分階段工具解鎖,讓系統先專注於視覺理解再進行搜尋;第二是可擴展的影片接地資料引擎,能夠自動產生高品質的多跳問答資料,且這些資料無法靠模型的記憶偷吃步;第三則是前述的 SFT 到 GRPO 兩階段訓練策略,讓智慧體從模仿走向真正的自主學習。這套框架的意義不僅在於單一模型的性能提升,更重要的是它提供了一個通用的藍圖,適用於不同規模的模型與不同類型的影片內容。

研究團隊在專案說明中強調,Video-DR 的目標是邁向「串流深度研究」的願景,也就是讓智慧體在觀看影片的同時,就能夠持續地理解、檢索、推理,最終達成「看得見一切」的視覺原生研究能力。這對於未來的新聞查證、學術研究、影片內容分析、自動化報告生成等應用場景,都具有相當深遠的潛力。目前研究團隊已將 Video-DR 的程式碼公開在 GitHub 上,提供學術界與開發者進一步使用與改進。隨著多模態模型持續往長影片、即時串流與視覺原生方向演進,這類強調「先看後查」的研究框架,勢必成為下一代人工智慧智慧體發展的重要參考。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
鈦媒體AI Agent

騰訊是在“賽馬”,還是在打造 “Agent工廠”?

騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。

36 分鐘前
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

2 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

7 小時前