視覺大模型迎來開源重磅消息!多模態生成再升級,2K高清音畫如何顛覆行業?

2026年8月3日 07:014800 次瀏覽

重點摘要

AI資訊AI新閒資訊正文視覺大模型迎來開源重磅消息!多模態生成再升級,2K高清音畫如何顛覆行業?發布於AI新閒資訊時間 :Aug 3, 2026閱讀 :1分鐘8 月 3 日,人工智能企業 MiniMax 正式宣佈開源其新一代通用視頻模型MiniMax H3。

站內 AI 整理稿

八月三日,人工智能企業 MiniMax 正式對外宣布,將新一代通用視頻模型 MiniMax H3 全面開源。這款模型的定位不僅僅是單一的視頻生成工具,而是一套完整的全模態生成系統。它能打破傳統任務之間的界線,將文本、圖像、視頻與音頻交織而成的複雜上下文進行深度融合與理解,並在此基礎上展現出極高的任務泛化能力。這意味著使用者不再需要為了不同素材類型切換不同工具,而是可以透過單一模型,處理更接近真實創作場景的多元輸入。在實際生成規格方面,MiniMax H3 提供了相當完整的選擇彈性。

模型支援輸出長度為 4 到 15 秒的動態影像,並具備 24 FPS 的幀率與 32 kHz 的立體聲音頻,讓畫面和聲音的呈現都能維持一定的品質水準。針對不同平台的觀看需求,使用者可以自由選擇 21:9、16:9、4:3、1:1 等多種常見寬高比。基礎創作模式下,模型會預設將畫面的較短邊設置為 768 像素,足以應付一般內容製作;而若追求更極致的畫質表現,則可透過專用的 H3-Regenerate-2K 方案,輸出高達 2K 分辨率的精細畫面,為高標準的視覺呈現提供技術支撐。除了影像與音訊的規格之外,MiniMax H3 在多語言交互層面也下了功夫。

該模型目前能夠穩定支援阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、西班牙語、葡萄牙語與俄語等 11 種主流語言。這樣的多語言能力,讓來自不同地區、使用不同語言的創作者,都能夠以自己習慣的語彙去描述想法、下達指令,大幅降低了跨語言創作時的溝通門檻,也讓模型在國際化的協作環境中具備更實際的應用價值。為了適應各種不同的創作場景,MiniMax H3 推出了兩種具備不同輸入規格的模型版本。首先是 H3-Base-FL2VA 首尾幀模式,這個版本支援輸入 0 到 2 張圖像,設計上相當靈活。

使用者可以單純輸入文字指令直接生成視頻,也可以提供一張首幀圖片來主導故事開場,或是給定尾幀圖片來指定結局畫面,甚至同時提供首尾兩張圖片,讓模型在設定的框架內進行內容演繹。這樣的多樣化輸入方式,讓創作者能依據當下的需求選擇最直覺的生成路徑。另一個備受專業創作者關注的版本是 H3-Base-Ref2VA 全模態參考模式。這個模式支援最多 9 張圖像、3 段總時長不超過 15 秒的視頻,以及 3 段音頻的混合輸入,所有素材檔案總數最高可達 12 個。

這種高容量的輸入設計,讓模型能夠一次接收大量的視覺與聽覺參考資料,進而在生成過程中精準掌握角色外觀、場景風格、氛圍節奏等細節,提供了前所未有的精細控制手段。對於需要嚴格把控內容風格的影視前製、廣告腳本或視覺概念設計來說,這樣的功能極具實用性。在系統架構的底層設計上,完整的 MiniMax H3 由三個核心模組共同組成。首先是 H3-Context-IR(上下文中間表示)模組,它扮演著理解與轉譯的關鍵角色,能將使用者提出的複雜多元指令進行深度剖析,轉化為模型易於理解的結構化資訊,確保高品質輸出的穩定性。接著是 H3-Base 模組,負責生成基礎的 768p 音視頻內容,為整體生成流程打下根基。

最後則是 H3-Regenerate-2K 模組,它會將初始生成的結果與原始上下文資料一同回傳,進行 2K 解析度的超分重構,讓最終作品在保留生動細節的同時,也能擁有更高的視覺保真度。目前,MiniMax H3 已正式基於 MiniMax H3 Community License 授權發布。對於有興趣嘗試或進一步開發的技術人員與創作者而言,現在就可以透過 Hugging Face 平台獲取完整的開源程式碼與相關資源。這代表的不只是技術文件的公開,更意味著全球的開發者社群都能夠在此基礎上進行二次開發、研究與應用落地。

業內普遍認為,此次 MiniMax H3 的開源,是視覺大模型領域一次極具意義的推進。透過開放原始碼與模型權重,多模態視頻生成的技術門檻將被進一步降低,讓更多中小型團隊甚至個人開發者,都有機會接觸並運用這項先進的生成技術。長遠來看,這股開源力量可望為影視創作、視覺設計、互動娛樂乃至於 AI 互動方式等領域,注入全新的活力,推動整個產業邁向更高的發展層次。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

1 小時前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前