視覺大模型迎來開源重磅消息!多模態生成再升級,2K高清音畫如何顛覆行業?

2026年8月3日 07:014800 次瀏覽

重點摘要

AI資訊AI新閒資訊正文視覺大模型迎來開源重磅消息!多模態生成再升級,2K高清音畫如何顛覆行業?發布於AI新閒資訊時間 :Aug 3, 2026閱讀 :1分鐘8 月 3 日,人工智能企業 MiniMax 正式宣佈開源其新一代通用視頻模型MiniMax H3。

站內 AI 整理稿

八月三日,人工智能企業 MiniMax 正式對外宣布,將新一代通用視頻模型 MiniMax H3 全面開源。這款模型的定位不僅僅是單一的視頻生成工具,而是一套完整的全模態生成系統。它能打破傳統任務之間的界線,將文本、圖像、視頻與音頻交織而成的複雜上下文進行深度融合與理解,並在此基礎上展現出極高的任務泛化能力。這意味著使用者不再需要為了不同素材類型切換不同工具,而是可以透過單一模型,處理更接近真實創作場景的多元輸入。在實際生成規格方面,MiniMax H3 提供了相當完整的選擇彈性。

模型支援輸出長度為 4 到 15 秒的動態影像,並具備 24 FPS 的幀率與 32 kHz 的立體聲音頻,讓畫面和聲音的呈現都能維持一定的品質水準。針對不同平台的觀看需求,使用者可以自由選擇 21:9、16:9、4:3、1:1 等多種常見寬高比。基礎創作模式下,模型會預設將畫面的較短邊設置為 768 像素,足以應付一般內容製作;而若追求更極致的畫質表現,則可透過專用的 H3-Regenerate-2K 方案,輸出高達 2K 分辨率的精細畫面,為高標準的視覺呈現提供技術支撐。除了影像與音訊的規格之外,MiniMax H3 在多語言交互層面也下了功夫。

該模型目前能夠穩定支援阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、西班牙語、葡萄牙語與俄語等 11 種主流語言。這樣的多語言能力,讓來自不同地區、使用不同語言的創作者,都能夠以自己習慣的語彙去描述想法、下達指令,大幅降低了跨語言創作時的溝通門檻,也讓模型在國際化的協作環境中具備更實際的應用價值。為了適應各種不同的創作場景,MiniMax H3 推出了兩種具備不同輸入規格的模型版本。首先是 H3-Base-FL2VA 首尾幀模式,這個版本支援輸入 0 到 2 張圖像,設計上相當靈活。

使用者可以單純輸入文字指令直接生成視頻,也可以提供一張首幀圖片來主導故事開場,或是給定尾幀圖片來指定結局畫面,甚至同時提供首尾兩張圖片,讓模型在設定的框架內進行內容演繹。這樣的多樣化輸入方式,讓創作者能依據當下的需求選擇最直覺的生成路徑。另一個備受專業創作者關注的版本是 H3-Base-Ref2VA 全模態參考模式。這個模式支援最多 9 張圖像、3 段總時長不超過 15 秒的視頻,以及 3 段音頻的混合輸入,所有素材檔案總數最高可達 12 個。

這種高容量的輸入設計,讓模型能夠一次接收大量的視覺與聽覺參考資料,進而在生成過程中精準掌握角色外觀、場景風格、氛圍節奏等細節,提供了前所未有的精細控制手段。對於需要嚴格把控內容風格的影視前製、廣告腳本或視覺概念設計來說,這樣的功能極具實用性。在系統架構的底層設計上,完整的 MiniMax H3 由三個核心模組共同組成。首先是 H3-Context-IR(上下文中間表示)模組,它扮演著理解與轉譯的關鍵角色,能將使用者提出的複雜多元指令進行深度剖析,轉化為模型易於理解的結構化資訊,確保高品質輸出的穩定性。接著是 H3-Base 模組,負責生成基礎的 768p 音視頻內容,為整體生成流程打下根基。

最後則是 H3-Regenerate-2K 模組,它會將初始生成的結果與原始上下文資料一同回傳,進行 2K 解析度的超分重構,讓最終作品在保留生動細節的同時,也能擁有更高的視覺保真度。目前,MiniMax H3 已正式基於 MiniMax H3 Community License 授權發布。對於有興趣嘗試或進一步開發的技術人員與創作者而言,現在就可以透過 Hugging Face 平台獲取完整的開源程式碼與相關資源。這代表的不只是技術文件的公開,更意味著全球的開發者社群都能夠在此基礎上進行二次開發、研究與應用落地。

業內普遍認為,此次 MiniMax H3 的開源,是視覺大模型領域一次極具意義的推進。透過開放原始碼與模型權重,多模態視頻生成的技術門檻將被進一步降低,讓更多中小型團隊甚至個人開發者,都有機會接觸並運用這項先進的生成技術。長遠來看,這股開源力量可望為影視創作、視覺設計、互動娛樂乃至於 AI 互動方式等領域,注入全新的活力,推動整個產業邁向更高的發展層次。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

25 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前