德國黑森林實驗室發佈Flux3 多模態模型:原生音頻生成, 20 秒音視頻同步輸出

2026年7月24日 06:027200 次瀏覽

重點摘要

德國黑森林實驗室發佈多模態基礎模型Flux3,基於Self-Flow架構及專用圖像、視頻、音頻、動作編解碼器,實現物理與數字環境的統一理解與生成。性能碾壓Luma、Runway,首次原生支持音頻生成,可一次性輸出20秒音視頻同步片段,並具備文本/圖像/視頻轉視頻、關鍵幀轉場和多語言對話等功能。

站內 AI 整理稿

德國黑森林實驗室(Black Forest Labs)近日正式發表全新多模態基礎模型 Flux3,這款模型採用自主研發的 Self-Flow 架構,並搭配專為圖像、影片、音訊與動作設計的編解碼器,能夠在物理與數位環境之間實現統一的語意理解與內容生成。不同於以往僅專注於視覺或文字的模型,Flux3 首次原生支援音訊生成,在不需額外拼接或後製的情況下,可直接輸出最長 20 秒的同步音影片片段,大幅簡化多模態內容的創作流程。根據官方釋出的資訊,Flux3 在生成品質與效率上已超越業界知名的 Luma 與 Runway 等平台,尤其在音畫同步、動作流暢度與細節還原方面表現突出。

這項突破意味著使用者只需輸入單一提示,即可獲得包含完整聲音與畫面的輸出,而無需分別處理音軌與影像,為影音創作、遊戲開發與虛擬實境等領域開創更直接的應用可能性。黑森林實驗室表示,Flux3 的 Self-Flow 架構是整個系統的核心。該架構透過統一的語意理解層,將文字、圖像、影片、音訊與動作等不同模態的資訊進行即時對齊,並利用專門設計的編解碼器,將這些資訊轉換為模型能夠高效處理的內部表示。這種設計不僅提升了生成內容的一致性,也讓模型能夠在更短的時間內產出高品質的成果。在實際應用上,Flux3 展現出多種靈活的轉換能力。

使用者可以從純文字描述直接生成一段包含聲音與動態畫面的影片,也能將一張靜態圖片轉換為具有連貫動作與音效的短片。此外,模型還支援從現有影片中提取語意訊息,並重新生成新的內容,甚至可以利用關鍵幀進行精確的轉場控制,讓創作者能夠更細膩地安排畫面節奏與音效搭配。值得注意的是,Flux3 還具備多語言對話功能,能夠在生成的內容中融入不同語言的語音與文字互動。這項能力讓模型不僅能產出單一語言的影音作品,還能根據使用者的需求,在影片中加入多國語言的旁白、對話或字幕,進一步拓展跨文化應用場景。例如,在製作教育內容或國際行銷素材時,創作者可以一次生成多語言版本,大幅節省後製成本。

從技術層面來看,Flux3 的同步音訊生成是一大亮點。傳統上,要產出帶有聲音的影片,通常需要先由影像生成模型產生畫面,再另外使用音訊生成模型製作音效或配樂,最後進行人工對齊與後製。這個過程不僅耗時,且容易出現音畫不同步的問題。Flux3 將音訊生成直接整合到模型內部,使得聲音與畫面在生成階段就自然同步,大幅提升最終作品的流暢度與真實感。黑森林實驗室強調,Flux3 的設計目標是讓 AI 能夠像人類一樣同時理解並生成真實世界中的多元資訊,為未來通用人工智慧提供更扎實的基礎。

透過將視覺、聽覺與動作等多種感知能力整合進單一模型,他們希望建立起一個能夠跨模態學習與推理的基礎架構,進而推動 AI 從單純的文本或圖像處理,邁向更全面、更貼近人類認知方式的智慧系統。在效能表現上,官方對比測試顯示,Flux3 在許多常見的生成任務中,無論是畫質、動作連貫性還是音效的自然度,都優於 Luma 與 Runway 等現有平台。尤其是在處理複雜場景,例如人物說話時的嘴型與語音同步、物體移動時產生的環境音效,以及長時間影片的穩定性等方面,Flux3 都展現出明顯的優勢。這項發表也引發業界對於多模態 AI 應用前景的熱烈討論。

影音創作者與遊戲開發者普遍認為,Flux3 的出現將大幅降低多媒體內容的製作門檻,讓個人創作者也能輕鬆產出高水準的影音作品。同時,虛擬實境與擴增實境領域的開發者則看好其對互動體驗的潛在影響,因為模型能夠即時生成與使用者的動作或環境變化相對應的視覺與聽覺回饋。此外,Flux3 的開放性也受到關注。黑森林實驗室表示,未來將提供 API 與開發工具,讓研究人員與企業能夠將模型整合到自己的應用中。這意味著除了直接的內容生成,Flux3 還可被用於自動化剪輯、智慧配音、互動式故事生成等更進階的場景,為 AI 創意產業注入新的動能。

總體而言,Flux3 的發表標誌著多模態 AI 模型在音訊與影片同步生成方面邁出了重要一步。黑森林實驗室透過 Self-Flow 架構與專用編解碼器的設計,成功解決了長期以來困擾業界的音畫整合問題,並在品質與效率上達到業界領先水準。隨著這項技術逐步落地,未來我們將看到更多由 AI 直接產出、無需繁複後製的影音內容,也為通用人工智慧的發展鋪設了更堅實的道路。

Related

相關文章

選秀捲土重來,這回來的都不是真人了

抖音近期出現AI生成虛擬偶像的選秀短劇,如《星光108》和《12星練賽》,完全複製傳統選秀模式但選手皆非真人,引發熱潮。這類節目成本低、產出快,觀眾可投票決定成團命運,但也引發缺乏真實情感與監管不確定性的爭議。AI選秀可能預示娛樂產業結構性變革,未來或與真人選秀走向融合。

3 小時前

小紅書發佈《AI 治理規則公告》:鼓勵主動披露 AI 生成,反對 AI 洗稿、合成他人聲音、捏造新聞

首頁 > IT資訊>網絡 小紅書發佈《AI 治理規則公告》:鼓勵主動披露 AI 生成,反對 AI 洗稿、合成他人聲音、捏造新聞 2026/8/7 15:49:00 來源:IT之家 作者:潞源 責編:潞源 評論: 感謝IT之家網友 軟媒用戶1238620 的線索投遞! IT之家 8 月 7 日消息,小紅書官方昨天發佈《AI 治理規則公告》,明確 AI 賬號的治理原則。

4 小時前

我,用美圖Agent,一句話拍出AI短劇

美圖公司推出「美圖Agent」新功能,使用者只需輸入一句話即可自動生成AI短劇,大幅降低創作門檻。該功能整合自然語言處理與影像生成模型,能將指令拆解成分鏡腳本並產出連續畫面,目前支援多種風格且可免費試用基本功能。此舉顯示美圖從修圖軟體轉向AI內容創作平台的企圖心,目標鎖定短影音創作者與品牌行銷需求。

9 小時前

Grokipedia被曝數月未更新,AI百科項目編輯功能陷停滯

馬斯克推出的AI百科項目Grokipedia被揭露自今年4月起內容更新基本停滯,過去三個月內沒有任何條目完成更新,用戶編輯請求也長期未處理。調查顯示此問題普遍存在於各類頁面,與早期數分鐘內完成修改的效率形成明顯反差,且該平台曾因直接引用維基百科及爭議性來源而受質疑。

17 小時前5700

美國祖父母熱衷將孫輩寫進 AI 生成童書,引發父母輩大量反感

首頁 > 智能時代>人工智能 美國祖父母熱衷將孫輩寫進 AI 生成童書,引發父母輩大量反感 2026/8/6 17:44:33 來源:IT之家 作者:清源 責編:清源 評論: IT之家 8 月 6 日消息,美國一些祖父母正熱衷於把孫輩寫進 AI 生成童書,卻讓孩子父母大為反感,甚至引發家庭矛盾。據《連線》雜誌當地時間 7 月 29 日報道,美國各地不少父母陸續收到孩子祖父母送來的 AI 童書。

1 天前

WorkBuddy 跑出來後,釘釘飛書放下了“入口”執念

WorkBuddy以AI代理為核心的新工具,促使釘釘與飛書放下過去對「入口」的執念,轉而將重心放在協作效率與場景落地。企業用戶不再迷信單一入口,更看重平台能否與其他系統順暢對接,讓AI在具體工作中產生實質效益。整體而言,競爭焦點從「圈住用戶」轉向「服務用戶」,AI能力與開放性成為下一階段的主導關鍵。

1 天前