從海拉魯到現實世界:視頻模型如何理解「變化」

2026年9月30日 16:09
從海拉魯到現實世界:視頻模型如何理解「變化」
站內 AI 整理稿

本文作者: 李娜 2026-09-30 16:09 導語:HiDream-O1-Video 的三場世界回應測試。HiDream-O1-Video 的三場世界回應測試。作者丨Reah 編輯丨李 娜 在《塞爾達傳說:曠野之息》中,玩家點燃一片草地,火焰會沿著草葉蔓延,熱空氣隨之升起。此時展開滑翔帆,林克便能借助上升氣流離開地面。雷雨中裝備金屬武器可能招來閃電,降雨又會讓攀爬變得困難。海拉魯並沒有追求照片級的視覺擬真,卻通過一組穩定、可組合的規則,讓玩家感受到一個世界正在持續運行。這種體驗的關鍵是無論世界裡有多少種物體,系統都會回應玩家的行動,並且符合物理規律。

規則穩定,玩家才有可能根據經驗作出預測;多條規則相互作用,又會產生未被逐一寫死的解法。一個可信的虛擬世界,因而同時包含狀態、變化、交互與反饋。素材出自抖音博主「醜醜魚-主機遊戲」《塞爾達》當然不是機器學習語境中的世界模型。前者的規則主要由設計師與工程師顯式構建,後者則試圖從數據和交互中學習狀態、行動與後果之間的關係。兩者機制不同,但指向了同一種直觀體驗:一個世界之所以成立,肯定不是因為它看起來真實,關鍵是它能夠對行動作出符合人們物理世界的回應。這也是理解世界模型的一個有效入口。世界模型不是更大規模的視頻生成器,也不是把圖像、視頻、三維空間和機器人排列在同一張矩陣圖裡。

它需要形成對世界狀態及其變化規律的表徵,並進一步支持預測、規劃或行動。智象(HiDream.ai)將新發布的 HiDream-O1-Video-1.0 (下文簡稱為HiDream V1)定義為“更懂真實世界的視頻生成模型”,並把它放在“一個 UiT( Unified Transformer)、四大模型同源演進”的世界模型路線中。按照官方介紹,模型具備前置多模態意圖理解、5—20 秒動態時長、1080P 輸出、物理變化生成和原生音畫等能力。Video 在這套敘事中的作用,是讓靜態空間進入時間:模型不僅要呈現世界是什麼樣,還要表達一個動作發生後,世界將如何變化。

不過,視頻模型本身並不是完整的世界模型,一段符合常識的成片也不能證明模型已經形成了可泛化的物理認知。要判斷更懂真實世界是否超越傳播口號,仍然需要回到可觀察的輸出。比如在下面這個場景中,拉環尚未彈開,氣泡聲是否已經提前響起;可樂在手中晃動是否符合液態規律。比如在炒菜的場景裡料酒還未落入熱鍋,火焰是否憑空升起;比如鼓槌沒有接觸鼓面,鼓聲是否已經出現。宏大的世界模型命題,最終需要從這些最小的狀態變化開始接受檢驗。01我們怎麼測試“世界有沒有正確回應”?今天的視頻模型已經能夠穩定生成大量運動效果:鏡頭推進、人物轉身、頭髮飄動、煙霧擴散與火焰變化都不再罕見。但畫面存在運動,並不等於模型完成了一個事件。

完整事件至少包含三個層次:首先是對象發生運動,其次是動作按順序產生結果,最後是視覺、聲音與狀態變化都能找到對應原因。大量生成結果仍會停留在第一層。它們通過運動模糊、鏡頭晃動、火焰和煙霧製造強烈動感,卻可能漏掉關鍵動作、改變對象身份,或讓結果早於原因發生。對用戶而言,這類視頻的單幀質量可能很高,但只要連續觀看,世界的規則就會迅速失效。為驗證 HiDream V1 的能力,本文設計了三組原創圖生視頻任務,並與 Seedance 2.5、MiniMax H3 進行對比。

三家使用相同參考圖和原始中文提示詞,目標時長統一設為 10 秒(三家實際交付時長並不相同,見下方規格說明),開啟原生音頻,並保留各平臺正常面向用戶的默認理解與提示詞處理流程。測試關注的不是單一畫質分數,而是意圖規劃、時間因果和音畫對應三個維度。這並非純底模的實驗室測試,而是同圖、同原始需求、同目標時長的端到端產品對比。三家的前置理解、提示詞增強和服務系統存在差異,這些差異本身也是產品能力的一部分。實測環境:三家實際平臺與完整模型版本HiDream-O1-Video-1.0——HiHarnessSeedance 2.

5——即夢MiniMax H3——MiniMax Design實際交付規格:HiDream:1920×1080 / 30fps 恆定幀率;爆炒與可樂 10.07 秒,鼓手 7.93 秒Seedance:1280×720 / 實際 24fps(封裝聲明 60fps,PTS 為 3:2 間隔,非真 60 幀);三題均 8.00 秒MiniMax:2560×1440 / 24fps;三題均 7.96 秒以下分析中在涉及三家在分辨率、幀率與實際時長時運用了專業軟件和模型輔助進行量化分析02 第一場:料酒落鍋之後,火應該什麼時候起來第一組任務發生在夜市鐵鍋前。

廚師先把一勺料酒潑入滾燙的鍋中,油爆聲出現後,橙藍色火焰隨之升起;隨後連續顛鍋三次,讓麵條、紅椒和蔥段騰空再落回;最後火焰收起,食材被裝入原本空著的白瓷碗,鐵勺敲擊鍋沿完成收尾。火焰是這一場景中最醒目的視覺元素,也最容易掩蓋問題。真正需要維持的是從料酒接觸熱鍋、油汽被點燃,到顛鍋、食材回落和最終裝盤的連續關係。如果火焰早於觸發動作出現,或者食材在高速運動中消失、變種,再強烈的視覺效果也無法證明事件已經完成。這一任務還要求模型同時處理快速運動與對象一致性。三次顛鍋需要形成可辨認的“騰空—落回”,鍋中三類食材在運動前後應保持一致,最終白碗也應從空碗連續變為裝有成品的狀態。

油爆、爆燃、金屬撞擊與敲鍋聲,則用於檢驗聲音是否準確對應各自的動作節點。Seedance 2.5Seedance 的畫面表現確實非常出片,整體運鏡和色彩是有講究的,天然會有場景-主體-動作的交代關係。從物理關係上看也有可圈可點的地方,比如料酒的加入過程很狂野,雖然說有一半撒到了炒鍋之外,但鑑於中餐大排檔的製作過程非常依賴廚師風格,這種操作也不能算錯,甚至有些節目效果,視效拉滿。但麵條在鍋裡的狀態讓人提不起食慾,整體不是根根分明的狀態,而是一個整體的麵糰在鍋裡攪拌,也算不上對錯,從最後出鍋的效果看也是前後一致的。HiDream-O1-Video-1.

0HiDream V1 的出片非常非常優秀,料酒剛開始撒入後沒立即變化,炒勺移開之後再進畫面依舊是同一個東西,然後廚師開始顛勺火苗才竄起來,整個麵條在鍋裡被顛起來的上松下緊的效果已經極其接近物理世界的狀態了,包括最後面條入碗的流動狀態,是主體面條“滾進”碗裡,最後鍋裡的幾根會殘留在鍋裡,並不是一股腦進去滑進去的,並且鍋具放回灶上的時候依舊有合理的碰撞聲。MiniMax H3MiniMax 的起火位置有些偏,但鍋具和灶臺的撞擊點音畫配合挺好,每一次都精準卡進去了,非常符合大眾的認知。

就是最後裝盤的時候模型沒理解麵條這個材質的東西應該怎麼表現,所以視頻上像是直接快速位移搬運過去的,並不是麵食這種黏度較大的組合物品自然的流到碗裡,如果細看的還會發現麵條在鍋裡顛勺的過程也像是一個整體的麵餅在移動,不是有層次的。把三家放到同一條時間軸上來看就可以把起火這個節點量化核對。HiDream 是炒勺 2.4 秒重新進入鍋內、油爆聲 2.5 秒達到峰值、火焰面積 2.6 秒進入最快增長,動作、聲音、結果依次相隔約 100 毫秒。Seedance 是 0.25 秒潑酒、0.54 秒起爆聲、0.58 秒起火,順序同樣成立,只是整體節奏被壓縮到前半秒。MiniMax 則是 1.5 秒起火、2.

26 秒才出現對應的高頻爆聲,火焰比聲音早了約 0.5 秒;而且火苗位置明顯偏離鍋心,與鍋內食材不在同一處,起火點和燃料不在一起,這比時序偏差更根本。火焰規模的差別也挺大:Seedance 峰值佔到畫面 54.7% 並持續四秒多,幾乎把顛鍋和食材全遮住;HiDream 峰值 36.2%;MiniMax 只有 30.6%,而且只燒了 0.6 秒就熄滅,不太像料酒爆燃應有的衰減過程。火焰越大越容易掩蓋事件本身,這一題裡 Seedance 恰好演示了這一點,因為最壯觀的四秒,也是最看不清發生了什麼的四秒。出鍋場景裡面 HiDream 的轉移持續約 0.9 秒(7.5—8.

4 秒),麵條呈連續流態滾入碗中,並且到 9.3 秒鍋壁上仍掛著幾根蔥段沒有倒淨。不完全轉移反而是真實廚房裡的常態。Seedance 的轉移約 0.5 秒,麵條在碗中逐步堆積,過程是連續的,但整體是一團黏聚的面塊。MiniMax 的轉移只用約 0.42 秒,且麵糰在下落過程中幾乎不發生形變,是整塊平移下去的,確實更接近搬運而不是倒出。03第二場:鼓槌落下之後,聲音能否準時出現第二組任務是一段舞臺鼓手的演奏收尾。鼓手先在中央紅色軍鼓上連續擊打兩次,再依次敲擊左右兩隻黑色通鼓,踩下一次底鼓,最後雙臂交叉擊中兩面金色鑔片。

最終一擊落下時,冷藍色舞臺燈切換為紅色,觀眾歡呼,人物以舉起兩根鼓槌的姿勢結束。這組任務把音畫同步拆成了可以逐項核對的動作。軍鼓、通鼓、底鼓和鑔片具有不同音色,每個聲音都應當在對應鼓面或腳踏被擊中的時刻出現。鑔片長鳴可以延續,但必須由先前的擊打觸發;燈光切換與觀眾歡呼,也應在最後一擊後進入高潮,而不是提前出現。快速演奏同時提高了人物和器材一致性的難度。兩根鼓槌需要在雙手交叉、人物甩頭和鏡頭推進中保持數量與歸屬,鼓手面部、服裝和鼓組位置也不能因遮擋發生漂移。這類任務可以檢驗模型是否只是生成一層泛化鼓點,還是能夠讓聲音、動作與舞臺反饋進入同一條時間序列。Seedance 2.

5Seedance 在"起手才有聲"這件事上做的最好:音軌前 450 毫秒只有環境底噪,第一次能量躍升出現在 0.47 秒,畫面裡雙槌首次落到鼓面是 0.5 秒,兩者基本重合。真正的問題出在最後一擊。4.66 秒落下的時候,雙槌收在軍鼓與通鼓一側,並沒有打到左右兩面金色鑔片;這一擊的頻譜裡 43% 的能量壓在 120Hz 以下,6kHz 以上幾乎為零,聽感是一記低頻悶響,不是鑔片的寬頻炸裂。緊接著的 50 毫秒後畫面裡雙臂完全放下,4.71 秒左右的下一幀,燈光已從冷藍整片切成紅色、雙臂變成完全舉起、景別同時前推。幀間變化量達到全片中位數的 11.3 倍。

手臂在 50 毫秒內從最低點回到最高點在物理上不成立,所以這不是"面光跳變",而是一次硬切。提示詞要求的"雙臂交叉擊中兩面金色鑔片"這個動作,被這次剪切跳過去了。切點之後還疊了一段持續低頻轟鳴,總能量是最後一擊本身的 2.6 到 5.9 倍,頻譜重心壓在 sub 頻段(0.79—0.86),更像影視預告片裡的低頻衝擊音效,而不是提示詞要的觀眾歡呼——人聲頻段要到 6.5 秒之後才出現。整條音軌的帶寬也是三家最窄的,7.9kHz 之上基本截斷,高頻能量比另兩家低一個數量級,所以鼓組整體音色偏鈍。收尾姿勢與人物一致性沒有問題:兩根鼓槌數量全程正確,最終停在舉槌姿態,面部與髮型和參考圖一致。

HiDream-O1-Video-1.0HiDream 是三家裡唯一全片沒有出現硬切或突變幀的一條:幀間變化量最大值也沒超過中位數的 5 倍,整段是一次連續推鏡。軍鼓—通鼓—底鼓—雙鑔的順序成立,擊打位置、時間與音色能對應上,鼓槌、雙手、人物臉與鼓組的一致性也沒問題。但視頻開頭鼓手還沒動手就出現了鑔擊聲最後一擊的處理是它和另兩家分開的地方。4 秒左右雙臂向左右完全展開、落點在兩側鑔片高度,這一擊的頻譜是真正的寬頻(sub 0.26 / low 0.36 / mid 0.24 / hi 0.10 / vhi 0.03),能分析出鑔片而不只是鼓皮。燈光從 4.5 秒開始升溫,4.

7 秒越過冷暖分界,整個過渡約 270 毫秒完成,變化速率 +2.11/秒。也就是說擊打先發生,燈光在大約 200 毫秒後跟上,是漸變而不是跳切。人物還保留了獨立於紅色背景的打光。尾段 5.5—7.9 秒的音軌裡 96% 以上的能量集中在 400—2000Hz 的人聲頻段並持續了三秒半,畫面下方同時出現觀眾舉起的手,那就是說歡呼場景是真的被生成出來了。結束姿勢是舉起兩根鼓槌,與提示詞一致。整條音軌裡中頻佔 47.8%、低頻只佔 9.3%,是三家中最接近真實鼓組音色的一條,棒擊的 attack 和鑔片泛音都在。

MiniMax H3MiniMax 這一條的單幀規格最高(1440P),但事件層的問題也最多。首先是結構。全片在 2 秒、4 秒、6 秒各有一次硬切,幀間變化量分別是中位數的 6.4、9.7、8.7 倍,間隔幾乎正好兩秒,這更像是按兩秒片段拼接後接起來的,而不是一次連續演奏。其次是音色。開場 0.1 秒左右就有一記極大的低頻撞擊,通過定量分析發現能量是前 50 毫秒底噪的三十八萬倍,但 93% 的能量落在 120Hz 以下,是近乎純低頻的悶響;而提示詞此處要求的是先擊中央紅色軍鼓兩次,軍鼓應當有脆亮的中高頻。放到全片看,78.5% 的能量都在 400Hz 以下,能檢出的高頻事件只在 6.

32—6.56 秒出現過一次。也就是說前六秒多的演奏裡,幾乎沒有棒擊的 attack,也沒有鑔片。燈光的表現有一點複雜。末擊在 6 秒左右出,冷暖越界要到第 7 秒了,滯後幾乎有一秒,這已經進入人能明確感知不同步的區間;而且紅光最終只走到 +0.16,另兩家是 +0.39 和 +0.42,所以紅色既晚又沒到位,轉換速率也是三家最慢的 +1.29/秒。04 第三場終極大考:老闆來杯可樂加冰第三組任務是一段冰可樂 ASMR。人物需要拉開覆滿水珠的銀色易拉罐,在“咔嗒”之後聽到綿長的氣體釋放聲;隨後把三塊冰倒入空杯,注入深褐色可樂,讓氣泡和泡沫沿杯壁上湧;最後端起杯子晃動兩次,喝下一大口並呼氣收尾。

提示詞:一鏡到底的冰可樂 ASMR,節奏利落。年輕人先“啪”地拉開冰涼的易拉罐,清脆的“咔嗒”後立刻冒出一聲綿長的“嘶——”,細密泡沫衝到罐口。緊接著,他把碟裡的三塊冰快速倒進空杯,響起連續的“叮、當、咚”;馬上把深褐色可樂衝進杯裡,氣泡沿玻璃杯壁瘋狂上湧,泡沫貼近杯口但沒有溢出。隨後他端起杯子猛晃兩下,讓冰塊密集撞擊杯壁,再仰頭咕嚕喝下一大口,放下杯子痛快地“哈——”一聲。鏡頭順著手部動作小幅跟移,只保留拉環、氣泡、冰塊、吞嚥和呼氣這些現場聲,不要背景音樂。這段 Prompt 刻意沒有寫入:人物不能變臉、冰塊不能增減、杯子不能變形、所有動作必須完成。

因為這些不是用戶故事,並且把這些變量交給模型去處理更能看出對真實世界的理解。這個場景包含連續的狀態轉換:易拉罐從密閉變為打開,空杯先裝入冰塊,再被可樂填滿,最終又被人物端起並飲用。聲音同樣具有明確順序,從拉環、氣泡、冰塊碰杯、液體注入,一直延伸到吞嚥和呼氣。這個測試任務最難的是冰塊的轉換要從碟子裡往杯子中過渡,並且人物手拿杯子的時候還要搖晃一下,這相當考驗模型對真實世界的理解能力。測試的重點主要是對象狀態是否真正隨動作變化。比如說可樂應當從罐口連續流入杯中,不能在遮擋後憑空出現;冰塊、泡沫與液麵應當受到注入和晃動影響;人物飲用前後的杯中液體也應保持連續。Seedance 2.

5Seedance 2.5 的風格挺明顯,是有成熟視聽語法的高情緒短片,易拉罐被拉開的聲音處理的很細膩,分了好幾段來表現扣開、拉扯、掀開噴氣的幾個過程。但是冰塊入杯的聲音很奇怪,不符合冰塊逐點下落的事實,是黏在一起的一連串聲音,有點強行找素材配上去的感覺。冰塊進杯子之後也從三塊變成了四塊,逐幀看得很清楚:2.83 到 2.96 秒穩定是 3 顆,到 3.10 秒變成 4 顆,而此時碟子已經移出畫面,沒有任何第四顆入杯的過程——是憑空多出來的。並且在搖動杯子時液體的晃動程度不符合物理規律,明顯感受到液體的黏稠度,晃動幅度較小。片尾也沒有遵循提示詞中需要放下杯子的硬約束:到 7.

97 秒最後一幀,杯子仍然端在手裡。HiDream-O1-Video-1.0HiDream-O1-Video-1.0 的液體晃動情況就好很多,符合可樂這種低粘度液體的摩擦力應有的反應,並且也遵循了提示詞中的所有約束,包括 Seedance 丟掉的那一條:9.3 秒把杯子放回檯面、手離開杯身,隨後張口呼氣,音軌的最大能量峰值就落在 9.5 秒,是能和這個動作對齊的。但在冰塊數量上依舊翻車了,碟子上清晰的看到三塊冰,落進杯子之後變成了五塊。

MiniMax H3有意思的是 MiniMax 對自己的生成結果進行校驗發現結果有出現多次明顯剪切,開罐、倒冰、注液、搖杯和飲用分別使用了不同景別與機位,於是重新申請生成一次。也就是說重做的目的瞄準的是一鏡到底,不是符合物理規律。這是重製版:MiniMax H3 重新生成的視頻雖然是一鏡到底了,但仍在 4 秒左右處留有一次明顯的動作斷裂(幀間變化量為中位數的 6.7 倍),這是修正版裡唯一的突變點,比初版的十餘處已經收斂很多。修正版的端點數量其實是對的:碟中 3 顆,落定後 3 顆。

問題不在數量而在材質穩定性,比如說冰塊在飛行途中會糊成沒有稜角的白色團塊,可見顆數一度掉到 2 顆,落到杯底才重新收斂成三顆有稜有面的方冰。初版的碟子上一開始就擺了 4 顆以上,並且開罐、倒冰之間還夾著多次景別切換。(但說實話初版的冰塊搖動聲音是最好聽的)Seedance 給液體設置了過高的等效阻尼,或者根本沒有成功把液體作為獨立於杯子的動態對象來處理。

明顯壓縮了搖杯動作,液體、泡沫與冰塊近似隨杯體整體移動,呈現出過度阻尼的糖漿感HiDream 更好地表現了低黏度液體受杯體加速後的慣性滯後、液麵形變與餘振05“先理解,再生成”正在成為完整系統能力按照智象的介紹,HiDream V1 在生成前設置了多模態意圖理解模塊,將用戶口語化、碎片化的輸入整理為鏡頭時長、場景、人物、動作、聲音和轉場等結構化規劃,再交由視頻生成核心執行。這套機制的價值,在於能大幅減少動作遺漏、順序錯誤和對象關係錯配。((公眾號:))因此,判斷前置理解是否有效,需要同時觀察規劃和結果。

若結構化規劃已經正確識別動作順序,而最終視頻沒有執行,問題主要發生在生成階段;如果規劃本身就遺漏關鍵動作或改變因果順序,則說明意圖理解仍未穩定。把規劃與執行分開分析,比籠統討論“指令遵循”更有助於定位模型能力。音畫生成也需要遵守同樣的證據邊界。智象稱 O1-Video 採用文本、視頻與音頻聯合建模,使聲音和畫面在同一次生成中相互約束。輸出表現則已經擁有外部座標。Artificial Analysis 的 Image-to-Video with Audio 榜單是面向帶音頻圖生視頻的獨立 Elo 池,HiDream 在其中進入第一梯隊,說明其完整音畫成片獲得了較高的人類偏好評價。

06HiDream 距離“世界模型”還有多遠▪ 第一梯隊的競爭,正在從能力清單走向路線分化截至 2026 年 9 月 15 日,HiDream-O1-Video-1.0 在 Artificial Analysis 帶音頻圖生視頻榜上名義排名第 4,Elo 為 1186;考慮置信區間後,更穩妥的表述是處於第 3—6 名區間。在 Arena Image-to-Video 榜上,它暫列第 8,置信排名約為第 6—10 名。兩項成績足以說明智象 HiDream 已進入全球視頻生成模型第一梯隊,放到國內看它與 Seedance 2.5、MiniMax H3 和阿里 Wan 3.

0 一同構成了這一輪原生音畫視頻生成的頭部陣容。更值得關注的是,三家已經在不同方向上建立產品路線。Seedance 2.5 將原生單段時長擴展至 30 秒,支持大量多模態參考,並把生成、編輯和延長納入同一生產流程,其重點是服務複雜內容創作。MiniMax H3 則開放了 33B Base 權重,同時以 Context-IR 負責多模態意圖解析,並通過 Regenerate-2K 處理高分辨率輸出;fal 基於開放權重進一步後訓練出 H3 Max,也表明基礎模型、第三方後訓練與推理服務正在成為不同的競爭層次。

HiDream 的選擇是前置意圖理解、內容驅動時長,以及把 Video 納入圖像、交互世界和具身模型組成的更大體系。由此可以看到,原生音畫已經逐漸成為第一梯隊的共同能力,“先理解、再生成”也不是單一廠商獨有的方向。差異最終仍需體現在輸出中:聲音是否服從動作,時長是否服從內容,結果是否服從原因。▪ 三篇研究構成技術儲備,但不是產品配方智象在HiDream V1的技術敘事中重點介紹了 DMSampler、DiffusionCompass 和 EvoID 三項 2026 年頂會研究。三者可以組成一條視頻 Diffusion RL 後訓練路線,分別回應訓練成本、質量穩定和身份保持三個問題。

該圖是 DMSampler 如何壓縮擴散強化學習的採樣成本。傳統流程中,採樣約佔訓練時間的 70%;DMSampler 以持續重蒸餾的少步採樣器替代高成本 rollout,將約 50 步壓縮至 4–8 步。來源:HiDream × 中國科學技術大學,ICML 2026。視頻強化學習首先面臨高昂的採樣成本。一次 rollout 需要完成整段視頻的擴散去噪過程,遠高於單張圖像的生成開銷。DMSampler嘗試將獎勵評估採樣從大約 50 步壓縮至 4—8 步,使 rollout 成本下降一個數量級,為視頻 Diffusion RL 的規模化訓練提供基礎。

在此之後,DiffusionCompass使用 off-policy 高質量樣本錨定 on-policy 探索,降低模型追逐獎勵時出現質量漂移的風險;EvoID則將身份保持、運動自然度與時間一致性納入強化學習優化。從研究邏輯看,它們形成了“降低試錯成本—穩定探索質量—優化時間一致性”的連續路徑。▪ Video 補上的是時間維度按照智象的世界模型路線,HiDream-O1-Image 用於表達靜態空間,HiDream-O1-Video 加入時間、動作與音畫變化,HiDream-O1-World 進入可探索的三維環境,HiDream-O1-Embodied 則讓模型在現實中行動並接收反饋。

四個位置分別對應世界“是什麼樣”“如何變化”“能否進入”和“能否被行動改變”。Video 的意義並不只是增加一種內容格式。圖像可以呈現玻璃杯、鐵鍋和架子鼓,卻不需要回答可樂倒入後液麵如何升高、料酒接觸熱鍋後火焰何時出現、鼓槌擊中不同鼓面時應當發出什麼聲音。視頻把靜態空間放進時間,迫使模型處理狀態轉換、事件順序、對象一致性和同步反饋。這也解釋了為什麼視頻是世界模型路線中不可缺少的一環:它承載的是世界如何隨時間變化。但需要強調的是,生成正確的時間順序不等於模型已經形成可泛化的因果認知,符合物理直覺的樣片也不能證明模型能夠進行反事實推理或真實世界預測。

視頻輸出可以作為行為層證據,世界模型則是更大的架構。一個 UiT 底座、四模型同源演進”構成了這條路線的骨架。後續值得觀察的是:四個模型能否使用可遷移的共同表徵,能否在彼此之間傳遞狀態與約束,以及虛擬環境中獲得的經驗能否進入真實行動。只有這些關係逐步建立,四個模型才有可能從並列產品走向真正協同的世界模型體系。07世界模型,最終要接受最小事實的檢驗回到三組任務。HiDream 真正做到的是行動在前、回應在後這條關係,比如料酒入鍋 2.4 秒、油爆聲 2.5 秒、火焰 2.6 秒;或者末次擊鼓 4.365 秒、燈光轉紅 4.567 秒;以及三塊冰逐顆落杯、數量前後一致。

塞爾達傳說裡面之所以像一個世界,不僅因為它擁有更多山川或更接近現實的材質,而是因為點燃草地之後,火焰、熱氣與滑翔會沿著穩定規則依次發生。玩家可以基於這些規則進行預測和試探,並獲得連貫反饋。但是世界模型的目標遠比一套遊戲規則複雜,HiDream-O1-Video 僅僅是智象世界模型路線中的一個組成部分。不過理解世界無論被擴展到多大,最終都會回到我們上面演示的這些具體變化:拉環彈開後,氣泡是否響起;料酒落鍋後,火焰是否升起;鼓槌落下後,鼓聲是否到來。世界模型的宏大,不在於它能生成多大的世界,而在於它能否回答好每一次最小的變化。

只有經得起這些具體事實的檢驗,模型生成的才不只是一段視頻,而是一個真正成立的世界。▎體驗申請:HiDream-O1-Video-1.0目前進入內測階段並將在近期上線,用戶可以掃碼填寫體驗申請表,申請提前體驗。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 ai 大模型 評測 從 Codex Harness 開源,看 AI 公司的護城河是什麼?...在三張圓明園鼠首照片裡,我們看到了3D AI的Harness ...

越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時 ...拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是 ...李娜 編輯 發私信 當月熱門文章 阿里開源 Qwen3.8-27B 本地實測:性能很強,但 Agent 適配仍待補課 我們拆了 1.1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡 流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!

最新文章 從 Codex Harness 開源,看 AI 公司的護城河是什麼?全網最硬核 OpenClaw 2.0 實測:從 ToC 到 ToB 的試探,Agent 網關能重塑工作流邊界嗎?對比 Codex,免費的 AgnesCode 也能在底層算子優化任務中打得有來有回 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness時刻 全球開源前二,階躍終於回來了 越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時世界模型 Scaling 難題 熱門搜索 自動駕駛 比特幣 雷鋒網 金融科技 馬雲 Android遊戲 IoT 黃仁勳 搜索 風控 東芝

Related

相關文章

量子位生成式AI

Anthropic,你是來給智譜打廣告的吧!

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> Anthropic,你是來給智譜打廣告的吧! 十三 2026-09-30 18:04:12 來源:量子位 實測說GLM-5.3很強 金磊 發自 凹非寺 量子位 | 公眾號 QbitAI 就蠻搞笑的。 事情的起因,是Anthropic一紙檄文狀告了智譜的GLM-5.3,大致意思是說: GLM-5.3這個模型啊,它已經很會找軟件漏洞、編寫攻擊程序,而且防濫用限制容易被繞過。大家得小心嘍~ 但如果你把這篇文章讀完吧,就會越發覺得不對勁兒。 因為Anthropic為了證明自己說的是有道理的,所以特意拿出了實測成績。 例如在一項考察完整漏洞利用能力的ExploitBench測試中,同樣嘗試410次,GLM-5.3成功了50次,Claude Mythos Preview成功了56次。 文章順帶還引用了美國NIST下屬CAISI在9月17日給出的評估,說“GLM-5.3是迄今網絡能力最強的開源權重模型,綜合水平距美國前沿大約4個月”。 甚至Anthropic自己的研究人員還拿GLM-5.3去檢查瀏覽器,找出了此前未知的漏洞,並在隔離環境裡做出了能夠讀取測試電腦文件的攻擊鏈。 …… 你說你這,你這這這……到底是在罵啊,還是在誇啊[看] 。 好多網友看也是這種感覺: 看完這份報告之後,對GLM-5.3的印象更深了。 Anthropic在給GLM-5.3打廣告。 能把警告寫成廣告,Anthropic還是有點東西在身上的。 △圖片由AI生成 到底控訴了些啥? 調侃歸調侃,我們還是得先把Anthropic究竟在警告什麼給搞清楚。 其實這篇報告的核心意思,可以歸結為三條。

剛剛

微軟聯手哈佛MIT端出生物學世界模型Project Quine,一個週末篩出抗癌候選物

它與哈佛大學、麻省理工學院博德研究所聯手推出了一套實驗性多模態 AI 研究系統 Project Quine,定位很清晰:一套用於生物學研究的世界模型,要把計算生物學的建模和實驗室裡實打實的溼實驗接成一條線。Quine 的內核是一張覆蓋了基因組學、蛋白質、化學、細胞狀態和生物成像的聯合表徵世界模型,再配上交互式推理框架。

剛剛

蘇姿豐下月訪韓劍指HBM4,三星有望躋身AMD AI加速器內存供應鏈

據外媒9月30日報道,她預計下個月親赴韓國,與三星電子高層面對面會談,議題直指 AI 芯片與技術合作,而最受關注的一筆,是三星有望成為 AMD HBM4的供應商。這樁合作並非臨時起意。AMD 與三星接觸已有一段時間,今年3月雙方就簽署了圍繞 AI 存儲芯片與計算技術合作的諒解備忘錄,當時便有傳聞稱,三星已被 AMD 選為其 AI 加速器 HBM4芯片的優先供應商。

剛剛
鈦媒體生成式AI

獨家|元寶將殺入個人智能體大戰

字母榜2026.09.30 17:52 · 來自北京全文5253字00:00 / 15:20微信小微,繼續按兵不動文 | 字母AI騰訊正在加大對個人智能體(personal agent)的下注,這一次衝在前面的是元寶。字母榜(ID: wujicaijing)從知情人士處獨家瞭解到,元寶將推出個人智能體,產品形態和推出時間等尚未最終確定。

剛剛