黑森林實驗室發佈Flux3 多模態模型 首次支持 20 秒原生音視頻同步生成
重點摘要
AI資訊AI新閒資訊正文黑森林實驗室發佈Flux3 多模態模型 首次支持 20 秒原生音視頻同步生成發布於AI新閒資訊時間 :Jul 24, 2026閱讀 :1分鐘 7月23日,德國人工智能初創公司黑森林實驗室(Black Forest Labs)正式發佈多模態基礎模型Flux3,標誌著生成式視頻技術迎來重大突破。
# 黑森林實驗室發布 Flux3 多模態模型,首度實現 20 秒原生音視頻同步生成
德國人工智能初創公司黑森林實驗室(Black Forest Labs)於 7 月 23 日正式推出其最新多模態基礎模型 Flux3,為生成式視頻技術樹立全新標杆。該模型不僅首次實現原生音頻與視頻的同步生成,更在長達 20 秒的片段中保持高度時序一致性,被業界視為通往通用「世界模型」的關鍵一步。 黑森林實驗室由 Stable Diffusion 核心創作者團隊於 2025 年成立,憑藉 Flux 系列開源圖像生成模型迅速崛起。此次發表的 Flux3 延續了團隊在生成式 AI 領域的技術積累,並首次將理解與生成範疇從靜態圖像延伸至動態視頻、音頻乃至行為動作,展現出跨模態統一建模的野心。 ## 基於 Self-Flow 架構,實現多模態統一建模
Flux3 採用全新設計的 **Self-Flow 架構**,配備專門開發的圖像、視頻、音頻及動作編解碼器,讓模型不再依賴外部模塊進行後期合成,而是從生成起點就將多種模態資訊融為一體。這種端到端的原生設計大幅降低了音畫不同步的問題,也讓模型對物理世界中時間、空間與因果關係的建模更加精確。 根據官方技術說明,這套架構能夠同時處理來自不同感官通道的輸入信號,並在同一潛在空間內完成推理與生成。配合新一代注意力機制與時序建模,Flux3 對於「杯子摔碎時的聲音與畫面」這一類高度耦合的事件,可以做到時間誤差控制在數幀以內。 ## 首款支援原生音視頻同步生成,輸出長達 20 秒
Flux3 最受關注的亮點,在於它是業界首款能夠 **原生生成同步音視頻** 的基礎模型。在單次推理中,模型即可輸出長達 20 秒的片段,同時生成與畫面高度對齊的環境音、背景音甚至人物對話。這項能力打破了以往「先合成視頻、再後期配樂或配音」的工作流程,為影視前期創意、遊戲素材生成和即時內容製作帶來了全新可能。 在功能層面,Flux3 涵蓋了文本轉視頻、圖像轉視頻、視頻轉視頻編輯以及基於關鍵幀的場景轉場,並首次整合多語言語音生成。創作者只需輸入一段文字描述,或者提供一張照片與一小段音頻範例,模型即可根據上下文生成具備特定語氣與情緒的完整片段。 ## 實測數據表現強勁:超越 Luma、Runway 同級模型
在第三方早期測試中,Flux3 以 720p 解析度、10 秒長度為基準進行盲比。結果顯示,其整體偏好率明顯領先當前主流競品:**勝過 Luma Ray 3.2 達 93%,擊敗 Runway Gen-4.5 達 77%**。即便面對同樣具備多模態背景的 Seedance 2.0 與 Google Gemini Omni Flash,Flux3 仍保持微弱優勢。 測試者指出,Flux3 在動態複雜度、物體一致性與音畫匹配度上尤為突出,尤其在需要連續運動和多物體互動的場景中,其生成的物理合理性明顯優於對照組。這讓許多早期體驗者認為,Flux3 已經接近「可以當作前期提案工具」的實用水準。 ## 結合機器人領域,Flux-mimic 在奧迪工廠展開測試
黑森林實驗室同步宣布與機器人公司 Mimic Robotics 合作,推出針對機器人領域的視頻動作模型 **Flux-mimic**。該模型能將視頻觀測資訊直接轉換為機器人可執行的動作指令,目前已在德國奧迪工廠投入生產任務測試,用於裝配線上部件識別與抓取動作規劃。 這一動向顯示黑森林的目標不只停留在內容生成,而是希望將多模態理解能力延伸到實體世界。透過將視覺、語言與動作表徵對齊,Flux-mimic 讓機器人可以在無需大量人工標註的情形下,直接從人類操作影片中學習動作技能。這為工廠自動化、家庭服務等場景提供了更高效的路徑。 ## 分階段推出:Flux3 Video 已上線,Image 與開源版本即將登場
根據官方路線圖,黑森林實驗室採取分階段推出策略。**Flux3 Video** 作為首發產品已正式對外開放,使用者可透過官方 API 及合作平台體驗即時生成的音視頻片段。隨後數週內,**Flux3 Image** 圖像生成模型也將陸續釋出。對於開源社群而言,備受期待的 **Flux3 Dev** 版本預計在不久後以開放權重形式提供,延續 Flux 系列一向的開源傳統。 此次 Flux3 的問世,不僅在技術指標上實現了跨越式進步,更象徵著生成式 AI 從「理解像素」邁向「理解世界」的轉折點。透過打破圖像、視頻、音頻與動作之間的資訊壁壘,黑森林實驗室正在將大模型的能力從虛擬內容延伸至現實環境感知與行動層面,朝向能夠同時理解與模擬物理世界的通用「世界模型」加速演進。業內分析認為,若這條技術路線得以持續推進,未來幾年內,AI 在影視、遊戲、機器人與自動駕駛等領域的應用邊界將被大幅改寫。
Related
相關文章

嚯!35家大型央國企實測後,因果世界模型落地了
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 嚯!35家大型央國企實測後,因果世界模型落地了 林, 方舟 2026-07-24 12:21:28 來源:量子位 林方舟 發自 凹非寺 量子位 | 公眾號 QbitAI 眼下,AI能幫人寫稿、編程、生成視頻,但離真正進入企業工作流、解決實際問題,經常還差一口氣。 特別是能源、製造、工業、醫藥這些高價值行業,企業需要的並不是隻會依照現有數據來生成內容的AI工具,而是一套能支撐生產調度、安全管控、風險研判和複雜方案決策的可靠智能系統。 少有產品能滿足這些需求。 WAIC期間,中數睿智發佈了“AI for Reasoning”因果智能體系,針對的就是這些痛點。 比如油氣鑽井的井控場景,井下壓力和流量突然不對勁,系統不只是輸出一句“存在風險”,而是能沿因果鏈定位病因,並推演多條幹預路徑:不處置會怎樣?立即關井會怎樣?延遲處置能撐多久、代價是什麼?輔助企業在事故發生前做出最優決策。 發佈會上還同步發佈了《因果世界模型技術體系藍皮書》,內容涵蓋了很多中數睿智公司對AI在複雜場景產業落地的思考與實踐,值得一讀。 成立於2020年的中數睿智,長期深耕企業級複雜智能決策賽道,客戶以大型央國企為主,積累了大量油氣、電力、製造、金融等領域的行業know-how。 AI進了企業,卻沒進決策室 AI在企業裡的滲透速度很快,真正轉化成利潤的速度卻沒跟上。 《藍皮書》援引麥肯錫《2025年人工智能現狀》報告的數據:88%的受訪企業已經在至少一項業務中使用AI,但實現可衡量利潤貢獻的企業只佔39%。 MIT NANDA發佈的《生成式AI鴻溝》給出另一個數字:企業級生成式AI項目的

Claude Opus、Sonnet 模型現已支持語音模式:讓對話“更有深度”
首頁 > 智能時代>人工智能 Claude Opus、Sonnet 模型現已支持語音模式:讓對話“更有深度” 2026/7/24 11:31:47 來源:IT之家 作者:清源 責編:清源 評論: IT之家 7 月 24 日消息,Anthropic 現已把 Claude Opus 和 Sonnet 模型納入語音模式,並將功能延伸至 Gmail、Slack 和 Canva 等應用。

Kimi 叫停新訂閱後,如何用上 K3
### Kimi 叫停新訂閱後,如何用上 K3? 愛範兒 · 2026年07月24日 11:18 Kimi 官方突然停止接受新的會員訂閱,讓許多還沒來得及體驗最新 K3 模型的用戶措手不及。不過,這並不代表徹底與 K3 絕緣。一個符合直覺的替代方案浮出水面:直接調用 API。理論上,只要準備一個 API Key,進行少量配置,就能繞過擁擠的官方入口,把這個強大的模型能力接到自己的電腦上,甚至還能接入 Claude Code 等第三方編程 Agent。但現實操作起來,真的如此絲滑嗎?

剛剛,Claude爆改語音,11種語言,就是沒中文
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作剛剛,Claude爆改語音,11種語言,就是沒中文新智元·2026年07月24日 10:58連輸入框都不需要的時代 剛剛,Anthropic和OpenAI同時放出了語音模式大升級! Claude這邊,從只能跑Haiku升級到Opus 4.8和Sonnet 5全系列,不僅能在對話裡調Gmail、日曆、Slack,還擴增到11種語言,但沒有中文。 OpenAI那邊,全雙工GPT-Live直接搬上了macOS和Windows桌面,動動嘴就同時指揮一整隊Agent,並且支持中文。 Claude Voice大升級 在此之前,Claude的語音模式只能跑Haiku,也就是最小的那個模型。 你跟它語音聊天,它能聽懂,但稍微複雜一點的問題就容易翻車。 現在,Opus 4.8和Sonnet 5都上了。 你可以在對話中途切換模型。系統自動調用所選模型的最快版本。注意,是最快版本,不是完整推理版本。 好消息是,語音模式會默認加載你上次文字聊天用的模型,文字和語音之間上下文不斷,無縫來回切。 交互方面,則有兩種模式:Hands-free持續監聽自動回覆,Push-to-talk按住說話鬆手結束。 當然,要說最重要的,那還得是「工具調用」。

2026 年菲爾茲獎得主 Jacob Tsimerman 宣佈加入 OpenAI
首頁 > IT資訊>人物 2026 年菲爾茲獎得主 Jacob Tsimerman 宣佈加入 OpenAI 2026/7/24 11:01:52 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 24 日消息,最新獲得國際數學界最高榮譽菲爾茲獎的得主 Jacob Tsimerman 宣佈加入 OpenAI。

OpenAI ChatGPT 桌面應用上線語音模式:用戶口述需求,AI 推進多項任務
首頁 > 智能時代>人工智能 OpenAI ChatGPT 桌面應用上線語音模式:用戶口述需求,AI 推進多項任務 2026/7/24 10:45:13 來源:IT之家 作者:故淵 責編:故淵 評論: 感謝IT之家網友 始終瘦不下 的線索投遞!