視覺大模型迎來開源重磅消息!多模態生成再升級,2K高清音畫如何顛覆行業?
重點摘要
AI資訊AI新閒資訊正文視覺大模型迎來開源重磅消息!多模態生成再升級,2K高清音畫如何顛覆行業?發布於AI新閒資訊時間 :Aug 3, 2026閱讀 :1分鐘8 月 3 日,人工智能企業 MiniMax 正式宣佈開源其新一代通用視頻模型MiniMax H3。
八月三日,人工智能企業 MiniMax 正式對外宣布,將新一代通用視頻模型 MiniMax H3 全面開源。這款模型的定位不僅僅是單一的視頻生成工具,而是一套完整的全模態生成系統。它能打破傳統任務之間的界線,將文本、圖像、視頻與音頻交織而成的複雜上下文進行深度融合與理解,並在此基礎上展現出極高的任務泛化能力。這意味著使用者不再需要為了不同素材類型切換不同工具,而是可以透過單一模型,處理更接近真實創作場景的多元輸入。 在實際生成規格方面,MiniMax H3 提供了相當完整的選擇彈性。模型支援輸出長度為 4 到 15 秒的動態影像,並具備 24 FPS 的幀率與 32 kHz 的立體聲音頻,讓畫面和聲音的呈現都能維持一定的品質水準。針對不同平台的觀看需求,使用者可以自由選擇 21:9、16:9、4:3、1:1 等多種常見寬高比。基礎創作模式下,模型會預設將畫面的較短邊設置為 768 像素,足以應付一般內容製作;而若追求更極致的畫質表現,則可透過專用的 H3-Regenerate-2K 方案,輸出高達 2K 分辨率的精細畫面,為高標準的視覺呈現提供技術支撐。 除了影像與音訊的規格之外,MiniMax H3 在多語言交互層面也下了功夫。該模型目前能夠穩定支援阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、西班牙語、葡萄牙語與俄語等 11 種主流語言。這樣的多語言能力,讓來自不同地區、使用不同語言的創作者,都能夠以自己習慣的語彙去描述想法、下達指令,大幅降低了跨語言創作時的溝通門檻,也讓模型在國際化的協作環境中具備更實際的應用價值。 為了適應各種不同的創作場景,MiniMax H3 推出了兩種具備不同輸入規格的模型版本。首先是 H3-Base-FL2VA 首尾幀模式,這個版本支援輸入 0 到 2 張圖像,設計上相當靈活。使用者可以單純輸入文字指令直接生成視頻,也可以提供一張首幀圖片來主導故事開場,或是給定尾幀圖片來指定結局畫面,甚至同時提供首尾兩張圖片,讓模型在設定的框架內進行內容演繹。這樣的多樣化輸入方式,讓創作者能依據當下的需求選擇最直覺的生成路徑。 另一個備受專業創作者關注的版本是 H3-Base-Ref2VA 全模態參考模式。這個模式支援最多 9 張圖像、3 段總時長不超過 15 秒的視頻,以及 3 段音頻的混合輸入,所有素材檔案總數最高可達 12 個。這種高容量的輸入設計,讓模型能夠一次接收大量的視覺與聽覺參考資料,進而在生成過程中精準掌握角色外觀、場景風格、氛圍節奏等細節,提供了前所未有的精細控制手段。對於需要嚴格把控內容風格的影視前製、廣告腳本或視覺概念設計來說,這樣的功能極具實用性。 在系統架構的底層設計上,完整的 MiniMax H3 由三個核心模組共同組成。首先是 H3-Context-IR(上下文中間表示)模組,它扮演著理解與轉譯的關鍵角色,能將使用者提出的複雜多元指令進行深度剖析,轉化為模型易於理解的結構化資訊,確保高品質輸出的穩定性。接著是 H3-Base 模組,負責生成基礎的 768p 音視頻內容,為整體生成流程打下根基。最後則是 H3-Regenerate-2K 模組,它會將初始生成的結果與原始上下文資料一同回傳,進行 2K 解析度的超分重構,讓最終作品在保留生動細節的同時,也能擁有更高的視覺保真度。 目前,MiniMax H3 已正式基於 MiniMax H3 Community License 授權發布。對於有興趣嘗試或進一步開發的技術人員與創作者而言,現在就可以透過 Hugging Face 平台獲取完整的開源程式碼與相關資源。這代表的不只是技術文件的公開,更意味著全球的開發者社群都能夠在此基礎上進行二次開發、研究與應用落地。 業內普遍認為,此次 MiniMax H3 的開源,是視覺大模型領域一次極具意義的推進。透過開放原始碼與模型權重,多模態視頻生成的技術門檻將被進一步降低,讓更多中小型團隊甚至個人開發者,都有機會接觸並運用這項先進的生成技術。長遠來看,這股開源力量可望為影視創作、視覺設計、互動娛樂乃至於 AI 互動方式等領域,注入全新的活力,推動整個產業邁向更高的發展層次。
Related
相關文章

原生支持 4K 圖像生成,商湯科技開源多模態模型 SenseNova U1.5-Lite-Preview 預覽版本
商湯科技宣佈開源輕量級多模態模型 SenseNova U1.5-Lite-Preview 預覽版本,原生支援 4K 圖像生成,並在多項生成與編輯評測上超越前代 U1。該模型以僅 8B-MoT 的規模,實現可比肩商用閉源模型的圖像生成與編輯效果。

英特爾:為開源多模態視頻模型 MiniMax H3 提供 Day 0 支持,實現基於多卡 GPU 的部署方案
首頁 > 智能時代>人工智能 英特爾:為開源多模態視頻模型 MiniMax H3 提供 Day 0 支持,實現基於多卡 GPU 的部署方案 2026/8/3 15:25:14 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: IT之家 8 月 3 日消息,英特爾今日宣佈,為新一代開源多模態視頻模型 MiniMax H3 提供 Day 0 首發支持。

當品牌開始爭奪AI的答案:翰智GEO入場
AI已取代搜尋引擎成為用戶獲取資訊的主要管道,品牌在AI問答中的形象變得更重要,GEO(生成式引擎優化)因而興起。央視「3·15」晚會揭露黑帽GEO亂象後,中國信通院發布行業標準,中央網信辦也啟動專項整治,合規與可信成為GEO入場門檻。企業級服務商翰智推出智慧版GEO業務,以可量化、可溯源、可驗收的工程化打法,搶進這條新賽道。

沐曦曦雲 C 系列 GPU 實現 Day 0 適配 MiniMax H3 多模態生成模型
沐曦股份宣布旗下曦雲 C 系列 GPU 完成對稀宇 MiniMax H3 多模態生成模型的 Day 0 適配,可快速部署並運用其多模態創作能力。此系列 GPU 採用自研架構,透過全棧自研 MXMACA 軟體棧,原生相容 PyTorch、TensorFlow 等 40 餘種主流 AI 框架,並支援超過 500 個 AI 模型穩定運行。

數億元!螞蟻AGI研究中心主任大模型創業,拿下新融資
杭州大模型公司西湖心辰宣布完成數億元人民幣B+輪融資,由廣發信德領投,螞蟻集團等老股東支持,資金將投入擴散語言模型研發、多模態實時互動產品迭代及海外市場拓展。該公司由現任螞蟻集團通用人工智能研究中心主任藍振忠創立,專注擴散範式大模型,並已在全球市場建立商業化閉環。

剛剛,阿里Qwen3.8-Max來了!衝進全球第一梯隊,模型表現直逼Claude
阿里巴巴突襲發表新一代基座大模型Qwen3.8-Max,總參數量達2.4兆,在編程、專業工作、長程任務與多模態分析等場景表現亮眼,於Arena榜單衝進全球第一梯隊,直逼Anthropic的Claude系列,部分程式能力甚至超過Claude Opus 5。官方並以低於國際大模型的價格策略(輸入每百萬Tokens人民幣12元等)吸引用戶,多位搶先體驗的網友也稱讚其性價比高、能自主完成從需求到交付的完整專案。