Black Forest Labs Releases FLUX 3: A Multimodal Flow Model for Image, Video, Audio and Robot Action Prediction
重點摘要
Black Forest Labs 發布 FLUX 3 多模態基礎模型,可在單一架構中同時處理影像、影片、音訊與動作預測,並首次從同一組權重輸出影片、音訊與動作。該模型基於 Self-Flow 方法並大幅擴展運算與數據資源,支援最長 20 秒的影片生成且內建音訊,在人類偏好測試中對比 Luma Ray 3.2 等競品獲得顯著優勢。
Black Forest Labs(BFL)正式推出 FLUX 3,這是一款能在單一架構中同時學習影像、影片與音訊的多模態基礎模型,也是首款從同一組權重輸出影片、音訊以及動作預測的 FLUX 系列模型。研究團隊在技術報告中指出,沒有任何一種單一模態能夠完整描述世界的全貌:影像捕捉的是單一瞬間的空間結構,影片則恢復了時間維度並展現物理動態,音訊更能揭示機械事件與聲音之間的因果關係。團隊將每一種模態視為對同一底層真實世界的有損投影,唯有同時訓練所有模態,才能讓它們彼此約束——聲音必須對應撞擊,運動必須符合質量。FLUX 3 正是 BFL 第一款完全基於此原則打造的模型。
支撐 FLUX 3 的核心技術是 Self-Flow,這是 BFL 發展出來的方法,旨在將多模態生成與理解整合在同一架構中。Self-Flow 將 flow matching 目標與自監督特徵重建目標結合在一起。BFL 在 GitHub 上以 Apache-2.0 授權釋出的參考實作採用 SiT-XL/2 架構,並加上 per-token timestep conditioning,訓練時使用 25% 的 per-token mask 比例,並從 EMA teacher(第 20 層)自我蒸餾到 student(第 8 層)。
該釋出 checkpoint 是 ImageNet 256×256 的研究模型,並非 FLUX 3 本身。BFL 強調,他們在同樣的方法基礎上「大幅擴展了運算與數據資源」,才能同時跨影片、影像與音訊訓練出 FLUX 3。Self-Flow 本身早在 2026 年 3 月就已發表,因此並非本次發布的新技術,真正的突破在於規模的放大。在影片生成方面,FLUX 3 Video 能夠在單次生成中產生長達 20 秒的片段,且自帶原生音訊。支援的模式涵蓋文字轉影片、圖片轉影片、從參考片段進行影片轉影片、關鍵幀轉影片以實現可控轉場,以及從輸入影片與音訊進行生成式影片音訊延續。
BFL 同時列出多語言對話、將片段連鎖成多鏡頭序列的代理式串接,以及具備動畫設計的強大字體生成能力。研究團隊特別指出,FLUX 3 在人臉表情的表現以及將聲音與物理事件關聯的能力上尤為突出。BFL 團隊公布了初步的人類偏好測試結果。測試設定為 10 秒文字轉影片、720p 解析度且含音訊的片段。結果顯示,FLUX 3 在與 Luma Ray 3.2 比較時,有 93% 的偏好率;對比 Runway Gen-4.5 則為 77%;對上 Grok Imagine Video 為 69%;Kling v3 Pro 為 60%;Happy Horse v1 為 59%;Happy Horse 1.
1 為 57%。而與 Seedance 2.0 及 Gemini Omni Flash 相比,偏好率落在 52%,接近隨機猜測的機率。這些數據展現了 FLUX 3 在多數競爭產品中的明顯優勢,尤其是對比 Luma 與 Runway 的最新版本時。FLUX 3 的推出象徵著多模態基礎模型邁向更統一的架構設計。BFL 團隊認為,過去模型往往只針對單一模態進行最佳化,忽略了不同感官訊號之間的互補關係。透過 Self-Flow 方法,FLUX 3 不僅能生成高品質的動態內容,也能在生成過程中自動確保聲音與視覺的物理一致性。例如,當畫面中出現物體墜落時,模型會同時產生對應的撞擊聲,而非單純的視覺結果。
這項能力對於影視製作、遊戲開發、虛擬實境以及機器人模擬等領域都具備重要的應用潛力。值得注意的是,FLUX 3 也具備動作預測能力,這使得它不僅限於媒體內容生成,還能應用於機器人領域。BFL 將動作預測視為另一種模態,讓模型能夠從視覺與音訊中學習物體的運動規律,並預測後續的物理行為。這項功能在來源資料中雖未詳細展開,但已明確指出 FLUX 3 是首款從同一組權重輸出影片、音訊與動作預測的 FLUX 模型,顯示 BFL 正將多模態學習的範疇從感知延伸到行動。
整體而言,FLUX 3 的發布延續了 Black Forest Labs 在擴散模型與 flow matching 領域的技術路線,並透過大規模訓練與 Self-Flow 的架構創新,將生成式 AI 的邊界從純視覺或純聽覺推向更全面的多模態理解。未來,隨著更多應用場景的落地,這類能夠同時處理影像、聲音與動作的基礎模型,可能成為下一代 AI 系統的核心組件。BFL 尚未公布 FLUX 3 的開放使用細節,但已經提供 Self-Flow 的參考實作供研究社群參考,展現其對開源與學術交流的支持。
Related
相關文章

選秀捲土重來,這回來的都不是真人了
抖音近期出現AI生成虛擬偶像的選秀短劇,如《星光108》和《12星練賽》,完全複製傳統選秀模式但選手皆非真人,引發熱潮。這類節目成本低、產出快,觀眾可投票決定成團命運,但也引發缺乏真實情感與監管不確定性的爭議。AI選秀可能預示娛樂產業結構性變革,未來或與真人選秀走向融合。

小紅書發佈《AI 治理規則公告》:鼓勵主動披露 AI 生成,反對 AI 洗稿、合成他人聲音、捏造新聞
首頁 > IT資訊>網絡 小紅書發佈《AI 治理規則公告》:鼓勵主動披露 AI 生成,反對 AI 洗稿、合成他人聲音、捏造新聞 2026/8/7 15:49:00 來源:IT之家 作者:潞源 責編:潞源 評論: 感謝IT之家網友 軟媒用戶1238620 的線索投遞! IT之家 8 月 7 日消息,小紅書官方昨天發佈《AI 治理規則公告》,明確 AI 賬號的治理原則。
我,用美圖Agent,一句話拍出AI短劇
美圖公司推出「美圖Agent」新功能,使用者只需輸入一句話即可自動生成AI短劇,大幅降低創作門檻。該功能整合自然語言處理與影像生成模型,能將指令拆解成分鏡腳本並產出連續畫面,目前支援多種風格且可免費試用基本功能。此舉顯示美圖從修圖軟體轉向AI內容創作平台的企圖心,目標鎖定短影音創作者與品牌行銷需求。
Grokipedia被曝數月未更新,AI百科項目編輯功能陷停滯
馬斯克推出的AI百科項目Grokipedia被揭露自今年4月起內容更新基本停滯,過去三個月內沒有任何條目完成更新,用戶編輯請求也長期未處理。調查顯示此問題普遍存在於各類頁面,與早期數分鐘內完成修改的效率形成明顯反差,且該平台曾因直接引用維基百科及爭議性來源而受質疑。

美國祖父母熱衷將孫輩寫進 AI 生成童書,引發父母輩大量反感
首頁 > 智能時代>人工智能 美國祖父母熱衷將孫輩寫進 AI 生成童書,引發父母輩大量反感 2026/8/6 17:44:33 來源:IT之家 作者:清源 責編:清源 評論: IT之家 8 月 6 日消息,美國一些祖父母正熱衷於把孫輩寫進 AI 生成童書,卻讓孩子父母大為反感,甚至引發家庭矛盾。據《連線》雜誌當地時間 7 月 29 日報道,美國各地不少父母陸續收到孩子祖父母送來的 AI 童書。

WorkBuddy 跑出來後,釘釘飛書放下了“入口”執念
WorkBuddy以AI代理為核心的新工具,促使釘釘與飛書放下過去對「入口」的執念,轉而將重心放在協作效率與場景落地。企業用戶不再迷信單一入口,更看重平台能否與其他系統順暢對接,讓AI在具體工作中產生實質效益。整體而言,競爭焦點從「圈住用戶」轉向「服務用戶」,AI能力與開放性成為下一階段的主導關鍵。