通用視頻模型 MiniMax H3 正式開源,支持多模態上下文、2K 分辨率

重點摘要
MiniMax 正式開源通用視頻模型 H3,支援文字、圖像、影片與音頻等多模態輸入,可生成最高 2K 解析度、15 秒且帶立體聲的影片。該模型透過任務泛化設計,能理解複雜指令,並提供多種輸入輸出規格,包含首尾幀與全模態參考模式。
MiniMax 於 8 月 3 日正式開源新一代通用視頻模型 MiniMax H3,這款模型定位為通用型全模態生成系統,能夠同時理解並處理文字、圖像、視頻與音頻組成的多模態上下文,並直接生成最高 2K 解析度、長達 15 秒且內建原生立體聲音頻的影片。官方表示,由於在設計階段就以任務泛化為核心導向,H3 在預訓練階段便已具備廣泛的多模態上下文理解與生成能力,因此能精準遵循複雜的多模態指令。在輸出規格方面,H3 支援的影片時長範圍為 4 至 15 秒,可產出多種寬高比,包括 21:9、16:9、4:3、1:1、3:4 與 9:16 等常見比例。
預設解析度會將較短邊設定為 768 像素,若啟用 H3-Regenerate-2K 功能,則可進一步提升至 2K 解析度。輸出幀率固定為 24 FPS,音訊部分則提供 32 kHz 立體聲品質。此外,模型在對話語言上穩定支援 11 種語言,涵蓋阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、葡萄牙語、俄語與西班牙語,對其他語言也提供不同程度支援。為了滿足不同應用場景,MiniMax H3 提供了兩種模型版本,分別對應不同的輸入模式。首先是 H3-Base-FL2VA,專注於首尾幀生成,可輸入 0 張、1 張或 2 張圖像。
不輸入圖像時即為純文字生成影片模式;僅輸入首幀圖像時,模型會根據首幀生成後續畫面;僅輸入尾幀圖像時,則根據尾幀倒推生成;若同時輸入首幀與尾幀,模型會自動生成中間過渡畫面,實現首尾幀影片生成。另一版本為 H3-Base-Ref2VA,屬於全模態參考模式,支援更豐富的輸入組合。圖像最多可輸入 9 張;影片最多 3 段,每段長度需在 2 至 15 秒之間,且總時長不超過 15 秒;音頻最多 3 段,但必須與圖像或影片一同輸入,無法單獨作為唯一輸入,每段音頻同樣需在 2 至 15 秒內,總時長不超過 15 秒。若採用混合輸入,所有類型檔案合計最多 12 個。完整的 H3 系統由三個模組組成,分工明確。
第一個模組為 H3-Context-IR,負責深入理解與提煉使用者輸入的多模態指令,並將其轉換為模型更容易處理的「上下文中間表示」(Context Intermediate Representation)。官方強調,這個步驟對最終輸出品質至關重要,建議開發者將 H3-Context-IR API 整合至生成流程,或參考提示詞指南自行建構上下文處理系統。第二個模組為 H3-Base,它會根據 H3-Context-IR 產生的中間表示來生成音頻與影片,並輸出 768p 解析度的結果。
第三個模組則是 H3-Regenerate-2K,它會將 768p 的初步生成結果連同原始上下文一同送回 H3,以 2K 解析度重新生成一次。這個設計不僅發揮了 H3 本身的生成能力,也充分利用原始輸入中蘊含的豐富資訊,從而產出細節更精準、視覺品質更佳的高解析度內容。MiniMax H3 採用 MiniMax H3 Community License 授權釋出,目前已開放原始碼與模型權重,開發者可在 Hugging Face 平台上獲取相關資源。這項開源舉措預計將推動多模態影片生成技術的普及,讓更多研究人員與開發者能夠基於此模型進行二次開發或應用整合。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。