通用視頻世界模型開發完成
重點摘要
通用視頻世界模型開發完成 近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。 過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。
通用視頻世界模型開發完成
近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。 過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。使用者無法改變觀察角度,也無法與生成內容互動。Wonder 的突破在於首次將「世界模型」與「即時相機控制」深度結合。只要提供一張圖片或一段參考影片,模型便能瞬間建立一個連貫的虛擬環境,使用者可以移動相機前往未見過的區域,甚至回訪先前觀察過的位置,整個過程流暢自然,且幾何結構與外觀保持一致。 這項能力的背後,是研究團隊從系統層面重新設計了三大核心模組:相機控制、記憶機制與訓練策略。在相機控制方面,團隊提出「密集座標場」作為新的條件輸入。透過在生成過程中渲染含有密集座標的參考圖,模型能直接將相機運動解讀為視覺證據,從而精準理解使用者的操控指令。這項設計解決了傳統控制方法中訊號模糊、反應遲緩的痛點,讓相機移動與生成畫面高度同步。 為了支援長時間、大範圍的場景探索,Wonder 配備了基於稀疏注意力的高效記憶機制。隨著生成長度增加,模型不需要處理全部歷史資訊,而是透過稀疏選擇少量相關的上下文標記進行記憶提取,實現快速且精確的回訪。這項設計大幅降低了計算成本,使模型能夠在長時程生成中維持場景的一致性,避免因上下文過長而出現遺忘或混亂。 訓練流程同樣經過精心改進。研究團隊針對自蒸餾(self-distillation)管線進行了多項修正,確保學生模型既能忠實遵循控制訊號,又能保留教師模型的生成多樣性與長期記憶能力。這些最佳化讓 Wonder 在控制精準度與內容豐富度之間達成了良好平衡,生成的影片不僅符合使用者預期,還保留了令人驚喜的細節變化。 在實際性能上,Wonder 交出了亮眼的成績單。它能夠以每秒 16 幀的速度即時生成數分鐘長度的影片,且在長時間滾動生成中保持連貫的幾何結構、外觀與動態。這意味著使用者可以在互動過程中獲得近乎即時的回饋,體驗流暢且沉浸,彷彿置身於一個微型的可探索世界。 除了從圖片生成影片,Wonder 也原生支援「影片條件生成」。使用者可以輸入一段已有的動態場景,讓模型即時重繪或延伸該場景,達到類似「重新拍攝」的效果。這項功能對影視後製、遊戲場景編輯等應用極具吸引力,創作者能在既有素材上自由調整視角,大幅提升工作彈性。 論文在 arXiv 上發布後迅速吸引社群關注,在 Papers with Code 平台獲得 11 個推薦,並已被收錄至多個論文合集。研究者提供的示範影片展現了模型在室內、戶外及複雜動態場景下的穩定表現;無論是細微的光影變化還是物體的持續運動,Wonder 皆能妥善處理,顯示其強大的泛化能力。 該研究由約翰霍普金斯大學與 Adobe Research 等機構共同完成,作者群包括 Jiacong Xu、Hanwen Jiang、Zhixin Shu、Kalyan Sunkavalli、Vishal M. Patel 與 Yiqun Mei。論文編號為 arxiv:2607.26037,目前已開放預覽,雖未公開完整模型權重,但專案頁面已提供多支示範影片,讓外界得以一窺其技術實力。 業界分析認為,Wonder 的問世可能為影片生成帶來新典範。在虛擬實境內容創作、自動駕駛模擬、互動式遊戲場景等領域,這種「可操控的世界模型」皆能派上用場。隨著後續研究繼續優化效能,甚至可能出現消費級應用,讓一般使用者在個人電腦上打造屬於自己的虛擬世界。 從「生成內容」到「生成可探索的世界」,Wonder 跨出了關鍵一步。這項研究不僅推進了影片生成模型的技術邊界,也為人機互動開啟了更具想像力的未來。隨著更多細節陸續公布,我們將持續關注這款模型能否真正落地,改變我們創造與體驗虛擬環境的方式。
Related
相關文章

這這這…翁荔光速回OpenAI上班了
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 這這這…翁荔光速回OpenAI上班了 Jay 2026-07-30 08:31:19 來源:量子位 6位聯合創始人——只剩2名。
輕量視覺語言動作模型面世
近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。

比特幣慌了?Mythos 60小時撬開後量子密碼算法
Mythos團隊在60小時內成功破解後量子密碼演算法,引發比特幣長期安全性疑慮。比特幣的橢圓曲線數位簽章演算法對量子電腦脆弱,業界呼籲盡快導入抗量子簽章方案。儘管目前無立即危險,但這項突破已為密碼學領域敲響警鐘。

“奧爾特曼”最新訪談:AGI即將到來,但權力集中才是真正威脅
這篇消息聚焦「“奧爾特曼”最新訪談:AGI即將到來,但權力集中才是真正威脅」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

誰在爭奪“具身大腦”?
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。
李飛飛出手!用世界模型訓練機器人,五種真機跑一小時不出錯
李飛飛團隊近期提出以世界模型訓練機器人的新方法,成功在五種不同真實機器人上進行測試,並達成連續運行一小時不出錯的穩健表現。這項成果顯示,透過世界模型的模擬與預測能力,能有效提升機器人在真實環境中的適應與執行任務的可靠度。 根據智東西的報導,該研究已在多種硬體平台上驗證,涵蓋不同形態的機器人,且長時間運作未發生失誤,展現世界模型在機器人領域的實用潛力。