終於!世界模型進入“有聲時代”:24FPS畫面+48kHz立體聲實時生成

世界模型在過去幾年雖能生成逼真的視覺畫面,卻始終無法同步產生對應的聲音,讓虛擬場景始終處於「無聲默片」的狀態。如今,這項重大限制終於被打破——由 Noiz AI 攜手香港科技大學、清華大學等研究機構共同推出的 HelixWorld 1.0,正式宣告成為首個可交互的音視頻世界模型,將世界模型帶入「有聲時代」。這套模型最核心的突破在於實現了畫面與聲音的即時同步生成。HelixWorld 1.0 支援 24 FPS 的幀率輸出,同時提供 48kHz 的立體聲取樣率,無論是物體碰撞、環境風聲,還是人物對話,都能在虛擬場景中即時產生相對應的音效,讓整體體驗更加沉浸。
相較於過去僅專注於視覺模擬的世界模型,HelixWorld 1.0 補上了聲音這塊關鍵拼圖,使 AI 生成的虛擬世界不再只是無聲的畫面。過去,世界模型在視覺生成上已經取得長足進步,能夠模擬動態場景、物理碰撞乃至人物動作,但聲音的生成一直是難以跨越的瓶頸。主要原因在於聲音與畫面的時序對齊難度極高,且需要同時考慮場景中的物體材質、空間位置、環境回音等複雜因素。HelixWorld 1.0 的出現,意味著這些技術挑戰已被克服,模型能夠在生成每一幀畫面的同時,計算出對應的聲場資訊,並即時合成為立體聲音訊。據了解,HelixWorld 1.
0 採用了一種全新的多模態聯合訓練架構,讓視覺編碼器與音頻編碼器在訓練過程中相互校準,確保生成的音效不僅與畫面中的動作同步,還能反映物體本身的聲學特性。例如,當畫面中出現金屬球撞擊木質桌面時,系統會產生清脆的金屬碰撞聲與木頭震動的低頻回音,而非單純的任意音效。這套模型不僅支援單向的畫面與聲音生成,還能實現互動式操作。使用者可以透過輸入文字指令或直接操控虛擬環境中的物體,模型會即時更新畫面與聲音,形成類似於即時遊戲引擎那樣的動態反饋。這使得 HelixWorld 1.0 在虛擬實境、遊戲開發、電影預覽、教育模擬等領域具備極大的應用潛力。
從技術規格來看,24 FPS 的幀率雖然不及高階遊戲的 60 FPS,但已能滿足一般動態場景的流暢需求,並且在即時生成的情況下,這樣的幀率已經相當可觀。而 48kHz 的立體聲輸出則與 CD 音質相當,能提供清晰且具空間感的聲音體驗,讓虛擬環境的聽覺真實度大幅提升。研究團隊表示,HelixWorld 1.0 的訓練資料涵蓋大量真實世界的音視頻片段,包括日常場景、自然環境、機械運作、人聲對話等,確保模型能夠掌握多樣的聲學模式。此外,模型還引入了時序注意力機制,讓聲音的生成不僅依賴當前幀的視覺資訊,還能參考前後文脈絡,避免聲音突然中斷或出現不自然的跳躍。
這項成果的發表,被視為世界模型領域的重要里程碑。過去,業界對於世界模型的定義多聚焦於視覺層面的物理模擬,而 HelixWorld 1.0 則首次將聲音納入核心架構,使模型的「世界感」更加完整。未來,AI 生成的虛擬世界不僅可以看,還可以聽,甚至可能進一步加入觸覺、嗅覺等感官模擬,但現階段聲音的加入已經讓沉浸感產生質的飛躍。目前,HelixWorld 1.0 已開放部分技術文件與示範影片,學術界與產業界均對其表現給予高度關注。
有分析認為,這項技術若能進一步提升幀率並降低延遲,將有望應用於即時通訊、遠端協作、虛擬會議等場景,讓使用者不僅能看到對方的表情與動作,還能聽到環境中的細微聲響,大幅提升遠距互動的真實感。對於遊戲開發者而言,HelixWorld 1.0 提供了一種全新的內容生成方式。傳統遊戲需要手動錄製或合成大量音效,並與遊戲邏輯綁定,耗時且成本高昂。而有了這套模型,開發者只需描述場景與動作,AI 就能自動生成對應的視覺與聽覺內容,大幅縮短開發週期。在教育與訓練領域,HelixWorld 1.0 也能發揮重要作用。
例如,模擬機械操作時,不同零件碰撞的聲音能幫助學員判斷操作是否正確;在語言學習環境中,虛擬場景中的對話與環境音能讓學習者更貼近真實語境。這些應用都仰賴於聲音與畫面的精準同步,而 HelixWorld 1.0 正好補足了過去世界模型在這方面的不足。值得注意的是,HelixWorld 1.0 並非單一團隊的成果,而是 Noiz AI 與香港科技大學、清華大學等學術機構的跨領域合作結晶。這種產學研結合的模式,為 AI 技術的落地提供了更堅實的理論基礎與實驗驗證。未來,研究團隊計劃進一步最佳化模型效能,並探索將聲音生成應用於更廣泛的場景,例如自動駕駛模擬中的環境音辨識、醫療模擬中的聽覺回饋等。
整體而言,HelixWorld 1.0 的問世,標誌著世界模型從視覺模擬正式跨入多感官同步模擬的時代。雖然目前仍處於早期階段,但聲音的加入已經讓虛擬世界有了「靈魂」,不再只是沉默的畫面,而是能與使用者產生聽覺互動的活生生環境。隨著技術持續演進,未來我們或許很快就能在 AI 生成的虛擬世界中,感受到與現實無異的聽覺體驗。
Related
相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界
世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤
作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。
數學自動形式化迎來重大突破:OpenBMB開源MathForm,8B模型憑實力逆襲大廠
OpenBMB團隊開源數學自動形式化框架、數據集與模型MathForm,目標是用Lean4讓機器準確讀懂並形式化驗證數學定理,攻克通用人工智能核心挑戰。其關鍵不是簡單翻譯自然語言,而是將每個數學概念精準映射到Mathlib庫中,為數學與AI交叉研究提供新工具。

加州伯克利數學教授撰文批評學生基礎差,卻被抓包“用 AI 寫的”
作者:清源 責編:清源 評論: 8 月 23 日消息,據英國《衛報》20 日報道,加州大學伯克利分校數學教授茲韋茲德利娜 · 斯坦科娃日前在《舊金山標準報》撰文批評部分學生存在“嚴重”的數學基礎缺失,卻又承認文章本身曾藉助 AI 編輯,由此引發爭議。

美國專家示警:學生依賴“AI 代寫”會削弱思考能力
作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。