何夕2077研究與前沿

通用視頻世界模型開發完成

2026年7月30日 00:00

重點摘要

通用視頻世界模型開發完成 近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。 過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。

站內 AI 整理稿

通用視頻世界模型開發完成

近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。使用者無法改變觀察角度,也無法與生成內容互動。

Wonder 的突破在於首次將「世界模型」與「即時相機控制」深度結合。只要提供一張圖片或一段參考影片,模型便能瞬間建立一個連貫的虛擬環境,使用者可以移動相機前往未見過的區域,甚至回訪先前觀察過的位置,整個過程流暢自然,且幾何結構與外觀保持一致。這項能力的背後,是研究團隊從系統層面重新設計了三大核心模組:相機控制、記憶機制與訓練策略。在相機控制方面,團隊提出「密集座標場」作為新的條件輸入。透過在生成過程中渲染含有密集座標的參考圖,模型能直接將相機運動解讀為視覺證據,從而精準理解使用者的操控指令。這項設計解決了傳統控制方法中訊號模糊、反應遲緩的痛點,讓相機移動與生成畫面高度同步。

為了支援長時間、大範圍的場景探索,Wonder 配備了基於稀疏注意力的高效記憶機制。隨著生成長度增加,模型不需要處理全部歷史資訊,而是透過稀疏選擇少量相關的上下文標記進行記憶提取,實現快速且精確的回訪。這項設計大幅降低了計算成本,使模型能夠在長時程生成中維持場景的一致性,避免因上下文過長而出現遺忘或混亂。訓練流程同樣經過精心改進。研究團隊針對自蒸餾(self-distillation)管線進行了多項修正,確保學生模型既能忠實遵循控制訊號,又能保留教師模型的生成多樣性與長期記憶能力。

這些最佳化讓 Wonder 在控制精準度與內容豐富度之間達成了良好平衡,生成的影片不僅符合使用者預期,還保留了令人驚喜的細節變化。在實際性能上,Wonder 交出了亮眼的成績單。它能夠以每秒 16 幀的速度即時生成數分鐘長度的影片,且在長時間滾動生成中保持連貫的幾何結構、外觀與動態。這意味著使用者可以在互動過程中獲得近乎即時的回饋,體驗流暢且沉浸,彷彿置身於一個微型的可探索世界。除了從圖片生成影片,Wonder 也原生支援「影片條件生成」。使用者可以輸入一段已有的動態場景,讓模型即時重繪或延伸該場景,達到類似「重新拍攝」的效果。

這項功能對影視後製、遊戲場景編輯等應用極具吸引力,創作者能在既有素材上自由調整視角,大幅提升工作彈性。論文在 arXiv 上發布後迅速吸引社群關注,在 Papers with Code 平台獲得 11 個推薦,並已被收錄至多個論文合集。研究者提供的示範影片展現了模型在室內、戶外及複雜動態場景下的穩定表現;無論是細微的光影變化還是物體的持續運動,Wonder 皆能妥善處理,顯示其強大的泛化能力。

該研究由約翰霍普金斯大學與 Adobe Research 等機構共同完成,作者群包括 Jiacong Xu、Hanwen Jiang、Zhixin Shu、Kalyan Sunkavalli、Vishal M.Patel 與 Yiqun Mei。論文編號為 arxiv:2607.26037,目前已開放預覽,雖未公開完整模型權重,但專案頁面已提供多支示範影片,讓外界得以一窺其技術實力。業界分析認為,Wonder 的問世可能為影片生成帶來新典範。在虛擬實境內容創作、自動駕駛模擬、互動式遊戲場景等領域,這種「可操控的世界模型」皆能派上用場。

隨著後續研究繼續優化效能,甚至可能出現消費級應用,讓一般使用者在個人電腦上打造屬於自己的虛擬世界。從「生成內容」到「生成可探索的世界」,Wonder 跨出了關鍵一步。這項研究不僅推進了影片生成模型的技術邊界,也為人機互動開啟了更具想像力的未來。隨著更多細節陸續公布,我們將持續關注這款模型能否真正落地,改變我們創造與體驗虛擬環境的方式。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

3 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

6 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

9 小時前