Black Forest Labs Releases FLUX 3: A Multimodal Flow Model for Image, Video, Audio and Robot Action Prediction
重點摘要
Black Forest Labs 發布 FLUX 3 多模態基礎模型,可在單一架構中同時處理影像、影片、音訊與動作預測,並首次從同一組權重輸出影片、音訊與動作。該模型基於 Self-Flow 方法並大幅擴展運算與數據資源,支援最長 20 秒的影片生成且內建音訊,在人類偏好測試中對比 Luma Ray 3.2 等競品獲得顯著優勢。
Black Forest Labs(BFL)正式推出 FLUX 3,這是一款能在單一架構中同時學習影像、影片與音訊的多模態基礎模型,也是首款從同一組權重輸出影片、音訊以及動作預測的 FLUX 系列模型。研究團隊在技術報告中指出,沒有任何一種單一模態能夠完整描述世界的全貌:影像捕捉的是單一瞬間的空間結構,影片則恢復了時間維度並展現物理動態,音訊更能揭示機械事件與聲音之間的因果關係。團隊將每一種模態視為對同一底層真實世界的有損投影,唯有同時訓練所有模態,才能讓它們彼此約束——聲音必須對應撞擊,運動必須符合質量。FLUX 3 正是 BFL 第一款完全基於此原則打造的模型。 支撐 FLUX 3 的核心技術是 Self-Flow,這是 BFL 發展出來的方法,旨在將多模態生成與理解整合在同一架構中。Self-Flow 將 flow matching 目標與自監督特徵重建目標結合在一起。BFL 在 GitHub 上以 Apache-2.0 授權釋出的參考實作採用 SiT-XL/2 架構,並加上 per-token timestep conditioning,訓練時使用 25% 的 per-token mask 比例,並從 EMA teacher(第 20 層)自我蒸餾到 student(第 8 層)。該釋出 checkpoint 是 ImageNet 256×256 的研究模型,並非 FLUX 3 本身。BFL 強調,他們在同樣的方法基礎上「大幅擴展了運算與數據資源」,才能同時跨影片、影像與音訊訓練出 FLUX 3。Self-Flow 本身早在 2026 年 3 月就已發表,因此並非本次發布的新技術,真正的突破在於規模的放大。 在影片生成方面,FLUX 3 Video 能夠在單次生成中產生長達 20 秒的片段,且自帶原生音訊。支援的模式涵蓋文字轉影片、圖片轉影片、從參考片段進行影片轉影片、關鍵幀轉影片以實現可控轉場,以及從輸入影片與音訊進行生成式影片音訊延續。BFL 同時列出多語言對話、將片段連鎖成多鏡頭序列的代理式串接,以及具備動畫設計的強大字體生成能力。研究團隊特別指出,FLUX 3 在人臉表情的表現以及將聲音與物理事件關聯的能力上尤為突出。 BFL 團隊公布了初步的人類偏好測試結果。測試設定為 10 秒文字轉影片、720p 解析度且含音訊的片段。結果顯示,FLUX 3 在與 Luma Ray 3.2 比較時,有 93% 的偏好率;對比 Runway Gen-4.5 則為 77%;對上 Grok Imagine Video 為 69%;Kling v3 Pro 為 60%;Happy Horse v1 為 59%;Happy Horse 1.1 為 57%。而與 Seedance 2.0 及 Gemini Omni Flash 相比,偏好率落在 52%,接近隨機猜測的機率。這些數據展現了 FLUX 3 在多數競爭產品中的明顯優勢,尤其是對比 Luma 與 Runway 的最新版本時。 FLUX 3 的推出象徵著多模態基礎模型邁向更統一的架構設計。BFL 團隊認為,過去模型往往只針對單一模態進行最佳化,忽略了不同感官訊號之間的互補關係。透過 Self-Flow 方法,FLUX 3 不僅能生成高品質的動態內容,也能在生成過程中自動確保聲音與視覺的物理一致性。例如,當畫面中出現物體墜落時,模型會同時產生對應的撞擊聲,而非單純的視覺結果。這項能力對於影視製作、遊戲開發、虛擬實境以及機器人模擬等領域都具備重要的應用潛力。 值得注意的是,FLUX 3 也具備動作預測能力,這使得它不僅限於媒體內容生成,還能應用於機器人領域。BFL 將動作預測視為另一種模態,讓模型能夠從視覺與音訊中學習物體的運動規律,並預測後續的物理行為。這項功能在來源資料中雖未詳細展開,但已明確指出 FLUX 3 是首款從同一組權重輸出影片、音訊與動作預測的 FLUX 模型,顯示 BFL 正將多模態學習的範疇從感知延伸到行動。 整體而言,FLUX 3 的發布延續了 Black Forest Labs 在擴散模型與 flow matching 領域的技術路線,並透過大規模訓練與 Self-Flow 的架構創新,將生成式 AI 的邊界從純視覺或純聽覺推向更全面的多模態理解。未來,隨著更多應用場景的落地,這類能夠同時處理影像、聲音與動作的基礎模型,可能成為下一代 AI 系統的核心組件。BFL 尚未公布 FLUX 3 的開放使用細節,但已經提供 Self-Flow 的參考實作供研究社群參考,展現其對開源與學術交流的支持。
Related
相關文章

AI情感陪伴大火,騰訊“復活”QQ寵物
AI情感陪伴大火,騰訊“復活”QQ寵物 黃昱 發表於 2026年07月27日 06:38 摘要:停運八年後重生 作者 | 黃昱 AI情感陪伴賽道,又迎來了一位“老朋友”。 7月27日,騰訊QQ宣佈QQ寵物正式煥新迴歸,用戶在手機QQ搜索“QQ寵物”即可重新領養。作為陪伴80後、90後成長的國民級互聯網IP,這隻曾經生活在電腦桌面的企鵝,在停運八年後要重新回到用戶身邊了。

AI推薦車型時在引用誰?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

QQ 寵物全新升級歸來,接入騰訊 Hy3 大模型
首頁 > 智能時代>人工智能 QQ 寵物全新升級歸來,接入騰訊 Hy3 大模型 2026/7/27 13:59:01 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 27 日消息,騰訊今日宣佈,QQ 寵物全新升級歸來。養寵玩法升級,熟悉日常更有沉浸感QQ 寵物升級為 3D 毛茸茸形象,保留餵食、洗澡、打工等經典玩法,沉浸式體驗養寵,寵物也能養成當紅巨星!

小紅書、B站、知乎“暗戰”WAIC
小紅書、嗶哩嗶哩與知乎在2025世界人工智能大會上暗中較勁,各自展示AI應用的不同策略,從流量爭奪升級為AI能力整合的比拼。小紅書強化種草與搜索,B站主打創作工具與虛擬主播,知乎則聚焦專業問答與知識圖譜,三方角力明顯。

長內容創作者苦AI失憶久矣,這個新Agent漂亮填坑!門檻低到只需要會用鍵盤打字
一款新AI Agent工具專為長內容創作者設計,解決AI在長篇寫作中常見的「失憶」問題,使用者只需打字即可操作。該工具透過動態記憶管理與分段思維鏈機制,自動維護創作記憶庫,確保前後邏輯連貫,大幅降低創作門檻。
紅果短劇發佈AI角色規範,專項整治“高頻AI臉”與素材侵權
AI資訊AI新閒資訊正文紅果短劇發佈AI角色規範,專項整治“高頻AI臉”與素材侵權發布於AI新閒資訊時間 :Jul 24, 2026閱讀 :1分鐘7月24日,紅果短劇發佈《關於規範AI劇角色創作的公告》,從角色差異化與版權合規兩個維度明確創作標準,旨在降低“高頻AI臉”使用率,防範素材違規風險。規範要求,單部劇集主要角色需具備清晰區分度與高辨識度,嚴禁跨劇或跨角色複用高度相似形象,以緩解審美疲勞。