Flux 3原生音視頻模型發佈
重點摘要
# 德國AI公司Black Forest Labs發布Flux 3原生音視頻模型,開創視覺智能新紀元 德國人工智慧公司Black Forest Labs(BFL)正式發布其最新旗艦模型Flux 3,這款多模態基礎模型同時學習圖像、影片與音訊,並首次實現原生音視頻生成長達20秒,標誌著AI視頻生成技術的重大突破。BFL將此視為邁向「真實世界視覺智能」的關鍵一步,致力於打造能夠在物理與數位環境中感知、預測並行動的世界模型。 ## 原生音視頻生成實現技術突破 Flux 3最引人注目的特點在於其原生音訊生成能力。
# 德國AI公司Black Forest Labs發布Flux 3原生音視頻模型,開創視覺智能新紀元
德國人工智慧公司Black Forest Labs(BFL)正式發布其最新旗艦模型Flux 3,這款多模態基礎模型同時學習圖像、影片與音訊,並首次實現原生音視頻生成長達20秒,標誌著AI視頻生成技術的重大突破。BFL將此視為邁向「真實世界視覺智能」的關鍵一步,致力於打造能夠在物理與數位環境中感知、預測並行動的世界模型。 ## 原生音視頻生成實現技術突破
Flux 3最引人注目的特點在於其原生音訊生成能力。與以往需要後期配音的AI視頻生成工具不同,Flux 3能夠在生成影片的同時,自動產生與畫面同步的音效與對話,影片長度最高可達20秒。BFL強調,該模型在人臉表情刻畫與物理聲效匹配方面表現尤為出色,能夠精準再現機械運作與聲音之間的因果關係。 在多模態訓練策略上,BFL採取「三合一」的創新路徑。公司指出,沒有任何單一模態能夠完整呈現真實世界的全貌:圖像展示空間結構,影片捕捉時間動態,音訊則揭示機械事件與聲音之間的內在關聯。將三者同時訓練,能讓不同模態相互填補不足,賦予模型比單一模態訓練更豐富的資訊理解能力。 ## 多項功能齊發,創作靈活度大幅提升
Flux 3支援多種創作模式,包括文字生成影片、圖片生成影片、影片轉換影片以及基於關鍵幀的過渡效果。值得一提的是,該模型還支援多語言對話生成,並可透過代理驅動的機制將單個片段串聯成更長的多鏡頭序列,為影片創作者提供前所未有的靈活性。 在早期評估中,BFL針對10秒720p影片進行偏好度測試,結果顯示Flux 3表現強勁:對比Luma Ray 3.2,獲得93%的偏好率;對比Runway Gen-4.5為77%;對比Grok Imagine Video為69%。即使面對更強勁的競爭對手,Flux 3依然展現競爭力:對Kling v3 Pro勝出60%,對Happy Horse v1為59%,對Happy Horse 1.1為57%,而與Seedance 2.0及Gemini Omni Flash的比較則各為52%。BFL強調這些為初步測試結果,目前尚無獨立第三方驗證。 ## 技術底層:Self-Flow架構與多模態變壓器
Flux 3的核心技術建立在BFL自主研發的「Self-Flow」方法之上,這種訓練方式讓單一模型同時具備內容生成與理解能力。模型採用多模態變壓器架構,配備專門的編碼器與解碼器,分別處理圖像、影片與音訊,將其轉化為共享的內部表徵後再還原為輸出。 BFL表示,這種統一學習流程無論在生成品質或模型對物理世界的理解程度上,都顯著優於傳統的流匹配方法。模型中的行動組件更為機器人應用奠定了基礎,展現出從感知到行動的完整能力鏈。 ## 攜手Mimic Robotics,進軍機器人領域
除了多模態生成能力外,BFL還與Mimic Robotics合作開發了「Flux-mimic」影片行動模型,專注於機器人應用場景。該模型目前已在大眾汽車集團旗下的奧迪進行生產任務測試,標誌著AI從內容生成走向物理世界實際應用的重要里程碑。 BFL認為,真正的視覺智能模型必須能夠「感知、預測並在物理與數位環境中行動」。Flux 3不僅能生成高品質內容,還能基於對世界的理解預測行動結果,這為未來通用機器人系統的開發鋪平了道路。 ## 分階段發布,開放權重助推行業發展
BFL計畫採取分階段策略逐步釋放Flux 3的全部功能,每個階段都設有早期反饋與安全測試環節。目前Flux 3 Video已開放使用,Flux 3 Image預計在未來數周內跟進,而行動預測功能將先透過特定合作夥伴提供。 值得關注的是,BFL宣布將以「Flux 3 Dev」為名,開放多模態基礎模型的權重存取。這項開源策略有望加速AI社群的創新步伐,推動多模態技術的廣泛應用。長遠來看,公司正致力於開發下一代模型,目標是將感知、行動與語言預測整合於單一統一模型之中。 隨著Flux 3的問世,Black Forest Labs不僅在影片生成領域樹立新標竿,更展現了AI從內容創作邁向真實世界理解的戰略願景。這項技術突破或將為娛樂、製造、機器人等多個產業帶來深遠影響。
Related
相關文章

DeepSeek不是理想主義公司,它只是把現實服務於理想
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道安徽最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作DeepSeek不是理想主義公司,它只是把現實服務於理想未來人類實驗室·2026年07月24日 12:26DeepSeek的答案,不是隻仰望星空,也不是隻腳踏實地,而是用現實問題去支撐一個足夠遠的目標。 DeepSeek的答案,不是隻仰望星空,也不是隻腳踏實地,而是用現實問題去支撐一個足夠遠的目標。 撰文 | 李嘉星 劉辰藝 編輯 | 張薇 頭圖來源 | DeepSeek 封面來源 | DeepSeek DeepSeek又一次被推到聚光燈下。 這家公司一度幾乎是AI圈最神秘的存在:工程師文化、低調,創始人很少公開露面,團隊也不像典型互聯網公司那樣頻繁講故事、做傳播。但過去一年,它幾乎每隔一段時間就會成為中文科技圈的中心。模型發佈時,它因為低成本和開源刷屏;融資消息傳出時,它因為估值和投資方引發討論;這一次,梁文鋒一場近4小時的投資人交流會錄音流出,又讓外界重新審視這家公司。 這一次,外界看到的是一個更完整、也更矛盾的DeepSeek。 一面是一個足夠遠的目標。梁文鋒談AGI,談願景,談“對世界的善意”,談不追求利潤最大化,談不開源就無法組織人。他說DeepSeek不想做下一個超級App,不想成為下一個字節或騰訊;公

Claude Opus5偷跑,第一波網友實測來了
這篇消息聚焦「Claude Opus5偷跑,第一波網友實測來了」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Kimi K3,已經撕裂了整個硅谷
# Kimi K3,一场撕裂硅谷的中国风暴 7月22日,四个事件在同一天发生,将中美AI产业的暗流彻底推向了台前。 白宫科技政策办公室主任Michael Kratsios在X上公开指控月之暗面(Moonshot AI)的Kimi K3涉嫌“大规模蒸馏”美国模型;OpenAI总裁Greg Brockman在接受Bloomberg采访时罕见承认K3“是一个很不错的模型”;近200家硅谷创业公司联名致信特朗普政府,警告若封禁中国开源模型,“将。

梁文鋒押注的方向,中國00後團隊先交卷了,性能直逼Opus 4.8
# 梁文鋒押注的方向,中國00後團隊先交卷了,性能直逼Opus 4.8 上週,AI圈接連發生兩件大事,揭開了一個關鍵賽道的序幕。7月15日,前OpenAI CTO Mira Murati在舊金山正式發布了Thinking Machines Lab的首個模型Inkling,這款975B參數的模型耗資20億美元,由100人精英團隊打造。幾乎同一時間,太平洋這一頭,一家成立不到一年的中國實驗室——Mind Lab,低調推出了自己的第一款作品Macaron-V1。748B參數,性能在多項評測中直逼甚至超越Opus 4.

估值 100 億美元,消息稱海外支付巨頭 Stripe 擬收購全球最大 AI 聚合平臺 OpenRouter
首頁 > 智能時代>人工智能 估值 100 億美元,消息稱海外支付巨頭 Stripe 擬收購全球最大 AI 聚合平臺 OpenRouter 2026/7/24 10:49:39 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 7 月 24 日消息,據《華爾街日報》今日援引知情人士消息,海外支付巨頭 Stripe 正與全球最大 AI 聚合平臺 OpenRouter 洽談收購事宜。
