黑森林實驗室發佈Flux3 多模態模型 首次支持 20 秒原生音視頻同步生成

2026年7月24日 02:326600 次瀏覽

重點摘要

AI資訊AI新閒資訊正文黑森林實驗室發佈Flux3 多模態模型 首次支持 20 秒原生音視頻同步生成發布於AI新閒資訊時間 :Jul 24, 2026閱讀 :1分鐘 7月23日,德國人工智能初創公司黑森林實驗室(Black Forest Labs)正式發佈多模態基礎模型Flux3,標誌著生成式視頻技術迎來重大突破。

站內 AI 整理稿

# 黑森林實驗室發布 Flux3 多模態模型,首度實現 20 秒原生音視頻同步生成

德國人工智能初創公司黑森林實驗室(Black Forest Labs)於 7 月 23 日正式推出其最新多模態基礎模型 Flux3,為生成式視頻技術樹立全新標杆。該模型不僅首次實現原生音頻與視頻的同步生成,更在長達 20 秒的片段中保持高度時序一致性,被業界視為通往通用「世界模型」的關鍵一步。 黑森林實驗室由 Stable Diffusion 核心創作者團隊於 2025 年成立,憑藉 Flux 系列開源圖像生成模型迅速崛起。此次發表的 Flux3 延續了團隊在生成式 AI 領域的技術積累,並首次將理解與生成範疇從靜態圖像延伸至動態視頻、音頻乃至行為動作,展現出跨模態統一建模的野心。 ## 基於 Self-Flow 架構,實現多模態統一建模

Flux3 採用全新設計的 **Self-Flow 架構**,配備專門開發的圖像、視頻、音頻及動作編解碼器,讓模型不再依賴外部模塊進行後期合成,而是從生成起點就將多種模態資訊融為一體。這種端到端的原生設計大幅降低了音畫不同步的問題,也讓模型對物理世界中時間、空間與因果關係的建模更加精確。 根據官方技術說明,這套架構能夠同時處理來自不同感官通道的輸入信號,並在同一潛在空間內完成推理與生成。配合新一代注意力機制與時序建模,Flux3 對於「杯子摔碎時的聲音與畫面」這一類高度耦合的事件,可以做到時間誤差控制在數幀以內。 ## 首款支援原生音視頻同步生成,輸出長達 20 秒

Flux3 最受關注的亮點,在於它是業界首款能夠 **原生生成同步音視頻** 的基礎模型。在單次推理中,模型即可輸出長達 20 秒的片段,同時生成與畫面高度對齊的環境音、背景音甚至人物對話。這項能力打破了以往「先合成視頻、再後期配樂或配音」的工作流程,為影視前期創意、遊戲素材生成和即時內容製作帶來了全新可能。 在功能層面,Flux3 涵蓋了文本轉視頻、圖像轉視頻、視頻轉視頻編輯以及基於關鍵幀的場景轉場,並首次整合多語言語音生成。創作者只需輸入一段文字描述,或者提供一張照片與一小段音頻範例,模型即可根據上下文生成具備特定語氣與情緒的完整片段。 ## 實測數據表現強勁:超越 Luma、Runway 同級模型

在第三方早期測試中,Flux3 以 720p 解析度、10 秒長度為基準進行盲比。結果顯示,其整體偏好率明顯領先當前主流競品:**勝過 Luma Ray 3.2 達 93%,擊敗 Runway Gen-4.5 達 77%**。即便面對同樣具備多模態背景的 Seedance 2.0 與 Google Gemini Omni Flash,Flux3 仍保持微弱優勢。 測試者指出,Flux3 在動態複雜度、物體一致性與音畫匹配度上尤為突出,尤其在需要連續運動和多物體互動的場景中,其生成的物理合理性明顯優於對照組。這讓許多早期體驗者認為,Flux3 已經接近「可以當作前期提案工具」的實用水準。 ## 結合機器人領域,Flux-mimic 在奧迪工廠展開測試

黑森林實驗室同步宣布與機器人公司 Mimic Robotics 合作,推出針對機器人領域的視頻動作模型 **Flux-mimic**。該模型能將視頻觀測資訊直接轉換為機器人可執行的動作指令,目前已在德國奧迪工廠投入生產任務測試,用於裝配線上部件識別與抓取動作規劃。 這一動向顯示黑森林的目標不只停留在內容生成,而是希望將多模態理解能力延伸到實體世界。透過將視覺、語言與動作表徵對齊,Flux-mimic 讓機器人可以在無需大量人工標註的情形下,直接從人類操作影片中學習動作技能。這為工廠自動化、家庭服務等場景提供了更高效的路徑。 ## 分階段推出:Flux3 Video 已上線,Image 與開源版本即將登場

根據官方路線圖,黑森林實驗室採取分階段推出策略。**Flux3 Video** 作為首發產品已正式對外開放,使用者可透過官方 API 及合作平台體驗即時生成的音視頻片段。隨後數週內,**Flux3 Image** 圖像生成模型也將陸續釋出。對於開源社群而言,備受期待的 **Flux3 Dev** 版本預計在不久後以開放權重形式提供,延續 Flux 系列一向的開源傳統。此次 Flux3 的問世,不僅在技術指標上實現了跨越式進步,更象徵著生成式 AI 從「理解像素」邁向「理解世界」的轉折點。

透過打破圖像、視頻、音頻與動作之間的資訊壁壘,黑森林實驗室正在將大模型的能力從虛擬內容延伸至現實環境感知與行動層面,朝向能夠同時理解與模擬物理世界的通用「世界模型」加速演進。業內分析認為,若這條技術路線得以持續推進,未來幾年內,AI 在影視、遊戲、機器人與自動駕駛等領域的應用邊界將被大幅改寫。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前