長視頻智能體按需取證
長視頻智能體「按需取證」突破算力瓶頸:一小時影片僅需5萬上下文令牌,精準回答細粒度問題 隨著多模態人工智慧技術的快速演進,長視頻理解始終是業界公認的「硬骨頭」。傳統方案傾向於將整段影片的畫面、音訊與文字資訊全數塞入模型上下文,試圖以「暴力全量」的方式讓AI「看完全片再作答」。然而,這種做法不僅造成巨大的計算資源浪費,更常因上下文過長而導致模型注意力分散,最終在回答具體細節時出現「記得住開頭、忘了結尾」的窘境。
近日,一項名為VideoXAgent的全新取證框架正式對外發布,其核心設計理念徹底顛覆了過往邏輯——不再「一次塞滿」,而是「按需調用工具」,讓智能體像人類偵探一樣,帶著問題去長片中精準尋找證據。這項框架的誕生,源於對長影片理解本質的重新思考。研究團隊指出,面對小時級別的影片,絕大多數問題其實只與其中極少數片段相關。例如,當使用者詢問「某個路牌在片中出現過幾次」時,AI並不需要理解整部影片的劇情脈絡,只需鎖定所有包含該路牌的畫面即可。
VideoXAgent因此設計了一套動態觸發機制:系統會先根據使用者提出的具體問題,判斷需要調用哪種工具——是OCR(光學字元識別)來讀取畫面中的文字,還是ASR(自動語音轉寫)來解析對話內容,抑或是目標檢測來定位特定物體。只有當問題確實涉及某種模態時,對應的模組才會被啟動,且僅針對與問題相關的時間點進行精準掃描。這種「帶著問題找畫面」的設計邏輯,帶來了極其顯著的效率提升。根據官方公布的測試數據,處理一小時長度的影片,VideoXAgent僅需約5萬個上下文令牌(tokens),遠低於傳統全量輸入方案動輒數十萬甚至上百萬的令牌消耗。
這意味著,在同等硬體條件下,該框架能處理的影片長度大幅增加,同時也降低了延遲與記憶體佔用。更重要的是,由於模型不再需要「硬扛」冗長的無關資訊,其注意力得以集中在真正關鍵的證據片段上,反而提升了回答的準確性。在複雜的基準測試中,VideoXAgent的表現已接近當前最先進的前沿模型,但資源消耗卻縮減了一個數量級,這在AI領域中實屬罕見的「效率與精度兼得」。細粒度問題的「精準狙擊」:從路牌次數到對話數字 長影片理解中最具挑戰性的,莫過於回答那些需要「精確計數」或「精確提取」的細粒度問題。
例如,「某個路牌出現過幾次」——這要求AI不僅要認出路牌,還要統計其出現的次數,且不能漏掉任何一次短暫的閃現;又如「某段對話中提到的具體數字」——這需要AI準確轉寫語音,並從連續的語流中抓取數字資訊。傳統全量模型在面對這類問題時,常因上下文過長而產生「注意力分散」現象,導致計數錯誤或數字混淆。VideoXAgent則透過「先定位、後取證」的兩階段策略,有效解決了此痛點。它會先利用輕量級的時間定位模組,快速篩選出可能包含答案的影片片段,再針對這些片段調用OCR或ASR工具進行高精度提取。由於每次處理的片段極短,模型能保持高度專注,因此對細節的捕捉能力大幅提升。
多模態證據鏈的逐步構建:讓AI「看得見」也「聽得懂」 長影片中的資訊往往交織於多種模態之間。一個場景中,人物可能正在說話,同時背景螢幕上顯示著關鍵數據。要回答「這個場景中人物說了什麼,同時背景里顯示了什麼」這類跨模態問題,傳統方案需要同時處理音訊與視覺資訊,並在兩者之間建立關聯。VideoXAgent的框架則將此過程拆解為可追溯的「證據鏈」:首先,智能體根據問題判斷需要同時調用ASR與OCR;接著,它會分別對同一時間段的音訊與畫面進行轉寫與識別;最後,將兩者的結果進行交叉驗證,並將每次取證的結果記錄下來,逐步疊加,最終形成一條完整的推理路徑。
這種「分步取證、逐步彙總」的方式,不僅提高了答案的可信度,也讓整個推理過程變得可解釋、可追溯——使用者可以清楚看到AI是依據哪些證據得出結論,而非像黑盒子般直接給出答案。可追溯的推理路徑:從「給答案」到「給證據」 「可追溯性」是VideoXAgent的另一大亮點。在傳統AI問答中,模型往往直接輸出最終答案,但使用者無法得知答案的來源。而VideoXAgent的每次取證結果都會被記錄並疊加,形成一個結構化的證據鏈。例如,當回答「這個場景中人物說了什麼,同時背景里顯示了什麼」時,系統會先展示ASR轉寫出的對話文字,再展示OCR識別出的背景文字,並標註兩者出現的精確時間戳。
這種「證據導向」的輸出方式,極大提升了AI系統在專業領域的可信度。對於需要嚴格審計的場景,如監控審查、影視內容審核,這種可追溯性幾乎是必備條件——審查人員可以逐條核對AI的判斷依據,而非盲目信任模型輸出。適用場景廣泛:監控審查、影視審核與多模態問答 從應用層面來看,VideoXAgent的「按需取證」特性,使其特別適合那些需要精準定位的長影片場景。在監控審查領域,安全人員常需在數小時的錄影中尋找特定事件,例如「某個車牌號在幾點出現」「某個人物在特定時間段內做了什麼」。傳統人工查閱耗時費力,而全量AI分析又成本高昂。
VideoXAgent則能根據查詢條件,快速鎖定相關片段,並提取車牌、人臉、行為等證據,大幅提升審查效率。在影視內容審核中,審核人員需要確認影片中是否存在違規文字、不當對話或敏感物體,VideoXAgent可自動調用OCR與目標檢測,對可疑畫面進行精準篩查,並生成帶有時間戳的審核報告。此外,在多模態問答系統中,使用者可以對長影片提出自然語言問題,系統則能像一位「記憶力超群的助理」一樣,迅速找到答案並附上證據。設計哲學:像人類一樣「帶著問題找畫面」 VideoXAgent的設計哲學,其實源自人類觀影的直覺。
當我們被問到「電影裡主角第一次戴帽子是什麼時候」時,我們不會重新把整部電影從頭到尾看一遍,而是會根據記憶中的印象,先鎖定幾個可能的時間點,再跳轉到那些片段進行確認。VideoXAgent正是將這種「帶著問題找畫面」的思維模式,轉化為可執行的演算法。它不再試圖讓AI「記住一切」,而是讓AI「知道該去哪裡找」。這種範式轉移,不僅解決了長影片處理的算力瓶頸,更為AI系統的設計提供了一種新的思路——在資訊爆炸的時代,真正的智慧不在於儲存所有資訊,而在於知道如何提取最關鍵的資訊。
未來展望:從「長影片」到「無限影片」的潛力 目前,VideoXAgent已支援多模態證據鏈的逐步構建,並在公開基準測試中取得了接近前沿模型的成績。但團隊表示,這只是起點。未來,該框架有望進一步擴展至更長的影片,甚至串流媒體的即時分析。透過持續優化時間定位演算法與工具調用策略,VideoXAgent有望將「按需取證」的優勢,從小時級影片延伸至全天候監控或長達數十小時的紀錄片。同時,該框架的設計也為其他長序列任務(如長篇文件分析、多輪對話理解)提供了啟示——「按需調用」而非「全量輸入」,或許是突破上下文長度限制的通用解法。
在AI算力成本日益高昂的今天,這種「精準取證」的智慧,無疑為長影片理解開闢了一條更為務實且高效的道路。
Related
相關文章

長安汽車首席專家譚歡:未來要用機器人造車、賣車,讓機器人上車、造機器人
作者:清源 責編:清源 評論: 9 月 18 日消息,在今天(18 日)的第 22 屆中國汽車產業發展(泰達)國際論壇“新賽道生態專場:具身智能新賽道”活動中,長安汽車首席專家、長安天樞智能機器人公司總經理譚歡在演講中指出,AI 正推動以物理具身智能為核心的基礎設施革新,汽車未來形態是“汽車機器人”—— 自學習、自組織、自進化的組合智能體。

具身智能技術路線尚未定型,基礎設施卻先收斂
具身智能技術路線尚未成形,但基礎設施需求已開始收斂,重點從製造機器人轉向持續迭代機器人能力。百度集團沈抖指出,智能體能力邊界快速擴展,進入規模化部署階段,但機器人學習新任務與跨環境適應性仍待突破。

88小時抵一個人思考4000年,OpenAI核心研究員:除了自我進化,更可怕的是AI正學會“隱藏自己”
AI正在把4000年的人類認知勞動壓縮進88小時,OpenAI研究員Noam Brown坦言連他自己也被進展速度持續震驚。AI正在把過去需要數千年完成的認知勞動壓縮到數天。真正的問題已經不只是模型能否變得更聰明,而是實驗能否跟上、人類能否在模型繼續自我改進前確認它仍然安全。
Agent辦事、花式P圖、動嘴玩電腦……實測Wildcat Lake輕薄本玩AI有多爽
作者 | ZeR0 編輯 | 漠影 桂林依山傍水,連城市的輪廓,都是一座座山勾勒出來的。抬眼一望,便是翰墨丹青般的自然光景,既沉靜婉約,又意境悠遠。這種乾淨的留白之美,早已被古人融入山水畫藝中,幾筆山石,一帶煙雲,餘下的留給水色,也留給看畫的人。 淨,並非空無一物,而是通過剋制的取捨,讓真正重要的東西凸顯出來。這與今年推出的第三代英特爾酷睿處理器(代號Wildcat Lake)的設計理念不謀而合。

吳恩達回應AI末日論:別被科幻敘事帶偏,應解決現實工程問題
吳恩達曾參與創辦Google Brain和Coursera。吳恩達稱,科技行業早期曾放大AI潛在災難性風險,以獲取關注並影響監管方向;近兩週相關討論再次升溫,也可能存在類似動機。他認為AI確實存在現實風險,尤其包括網絡安全等領域,但不認同將人類滅絕風險作為當前AI發展的核心判斷依據。

智譜 GLM-5.3-FlashX 模型上線,更快、更流暢
作者:汪淼 責編:汪淼 評論: 感謝網友 Agent 的線索投遞!9 月 18 日消息,智譜今日宣佈推出 GLM-5.3-FlashX(最高 200 tokens/s),為企業與開發者帶來更快、更流暢的模型體驗。智譜官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名與全球開發者見面,獲得海內外開發者的廣泛認可,調用量持續攀升。