黑森林實驗室放出 Flux3:首個原生生成音頻的多模態基礎模型,20 秒音畫同步一次成型
重點摘要
AI資訊AI新閒資訊正文黑森林實驗室放出 Flux3:首個原生生成音頻的多模態基礎模型,20 秒音畫同步一次成型發布於AI新閒資訊時間 :Jul 24, 2026閱讀 :1分鐘德國人工智能初創公司黑森林實驗室(Black Forest Labs)正式發佈多模態基礎模型 Flux3。它基於 Self-Flow 架構打造,配備專用的圖像、視頻、音頻及動作編解碼器,把對物理世界與數字環境的統一理解與生成攬到了一起。最扎眼的一點是音視頻同步。
德國人工智能初創公司黑森林實驗室(Black Forest Labs)近日正式發表多模態基礎模型 Flux3,這是業界首個原生支援音頻生成的統一架構,能夠在 20 秒內一次產出音畫同步的影片片段,將文字、圖像、影片與聲音的生成能力整合在同一套模型底座上。Flux3 採用全新的 Self-Flow 架構,並配備專為影像、影片、音頻與動作模態設計的編解碼器。這套設計讓模型得以同時理解與生成物理世界與數位環境中的多種資訊形式,不再只是擅長某一種單一媒體的「專科」模型,而是具備跨模態協作能力的基礎系統。
黑森林實驗室指出,Flux3 是第一款能夠原生生成音頻的多模態模型,這意味著聲音不再是後製合成的附加元件,而是模型在生成影片時同步產出的內容。在實際應用中,用戶只需輸入一段文字描述或一張圖片,Flux3 就能在 20 秒內產出搭配環境音效、對話或背景音樂的影片,大幅縮短內容創作流程。除了文字與圖像生成影片外,Flux3 還支援影片轉影片、基於關鍵幀的轉場效果,以及多角色對話場景。這些功能讓它適用於廣告製作、動畫設計、虛擬人物互動,甚至是即時內容生成等多元場景。在早期效能測試中,黑森林實驗室將 Flux3 與當前市場上幾款頂尖模型進行比較。
在 720p 解析度、10 秒片段長度的設定下,Flux3 對上 Luma Ray3.2 的勝率高達 93%,對 Runway Gen-4.5 也有 77% 的優勢。即便面對 Seedance2.0 與 Gemini Omni Flash 這類同樣具備強大多模態能力的模型,Flux3 仍能維持微弱上風,展現出在生成品質與一致性方面的競爭力。值得注意的是,Flux3 的多模態能力不僅停留在螢幕上,更已開始進入實體世界。黑森林實驗室與機器人公司 Mimic Robotics 合作,開發出專為機器人領域設計的動作模型 Flux-mimic。
這款模型目前已在奧迪工廠內執行生產任務測試,將生成式 AI 從內容創作延伸到產線操作,驗證了多模態基礎模型在工業自動化中的潛力。黑森林實驗室強調,Flux3 的誕生代表多模態 AI 邁入新階段。過去模型往往需要在不同模態之間切換或依賴後處理來對齊,而 Flux3 從底層架構就將音頻與視覺資訊視為一體,讓生成結果更自然、更同步。這項技術對於需要即時音畫匹配的應用,如虛擬會議、互動遊戲、自動影片配音等,將帶來顯著改善。目前 Flux3 已開放部分合作夥伴進行測試,黑森林實驗室預計在未來幾個月內逐步擴大存取權限。
公司也透露,後續版本將進一步提升解析度與生成長度,並探索更多垂直領域的應用,例如教育、醫療模擬與自動駕駛感知系統。值得注意的是,Flux3 的名稱沿襲自黑森林實驗室先前推出的 Flux 系列模型。該系列過去以高品質的靜態影像生成聞名,而 Flux3 則將能力擴展至動態影片與音頻,標誌著公司從單一模態走向多模態的重要轉折。業界分析認為,隨著 Flux3 的問世,生成式 AI 的競爭將從「誰能生成更好的圖像」轉向「誰能更流暢地整合聲音、影像與動作」。黑森林實驗室總部位於德國,團隊成員來自多所頂尖研究機構與科技公司,專注於開發可擴展的基礎模型。
此次與 Mimic Robotics 的合作,也顯示出歐洲 AI 新創在工業領域的布局力道。奧迪工廠的測試案例,則為未來更多製造業導入生成式 AI 提供了具體參考。整體而言,Flux3 的推出不僅是技術上的突破,更可能重新定義內容創作與機器人控制的邊界。當一個模型能夠同時「聽」與「看」,並在 20 秒內產出完整的多媒體結果,其應用場景將遠超我們目前的想像。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣
過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。