IT之家生成式AI

通用視頻模型 MiniMax H3 正式開源,支持多模態上下文、2K 分辨率

2026年8月3日 10:52
通用視頻模型 MiniMax H3 正式開源,支持多模態上下文、2K 分辨率

重點摘要

MiniMax 正式開源通用視頻模型 H3,支援文字、圖像、影片與音頻等多模態輸入,可生成最高 2K 解析度、15 秒且帶立體聲的影片。該模型透過任務泛化設計,能理解複雜指令,並提供多種輸入輸出規格,包含首尾幀與全模態參考模式。

站內 AI 整理稿

MiniMax 於 8 月 3 日正式開源新一代通用視頻模型 MiniMax H3,這款模型定位為通用型全模態生成系統,能夠同時理解並處理文字、圖像、視頻與音頻組成的多模態上下文,並直接生成最高 2K 解析度、長達 15 秒且內建原生立體聲音頻的影片。官方表示,由於在設計階段就以任務泛化為核心導向,H3 在預訓練階段便已具備廣泛的多模態上下文理解與生成能力,因此能精準遵循複雜的多模態指令。 在輸出規格方面,H3 支援的影片時長範圍為 4 至 15 秒,可產出多種寬高比,包括 21:9、16:9、4:3、1:1、3:4 與 9:16 等常見比例。預設解析度會將較短邊設定為 768 像素,若啟用 H3-Regenerate-2K 功能,則可進一步提升至 2K 解析度。輸出幀率固定為 24 FPS,音訊部分則提供 32 kHz 立體聲品質。此外,模型在對話語言上穩定支援 11 種語言,涵蓋阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、葡萄牙語、俄語與西班牙語,對其他語言也提供不同程度支援。 為了滿足不同應用場景,MiniMax H3 提供了兩種模型版本,分別對應不同的輸入模式。首先是 H3-Base-FL2VA,專注於首尾幀生成,可輸入 0 張、1 張或 2 張圖像。不輸入圖像時即為純文字生成影片模式;僅輸入首幀圖像時,模型會根據首幀生成後續畫面;僅輸入尾幀圖像時,則根據尾幀倒推生成;若同時輸入首幀與尾幀,模型會自動生成中間過渡畫面,實現首尾幀影片生成。 另一版本為 H3-Base-Ref2VA,屬於全模態參考模式,支援更豐富的輸入組合。圖像最多可輸入 9 張;影片最多 3 段,每段長度需在 2 至 15 秒之間,且總時長不超過 15 秒;音頻最多 3 段,但必須與圖像或影片一同輸入,無法單獨作為唯一輸入,每段音頻同樣需在 2 至 15 秒內,總時長不超過 15 秒。若採用混合輸入,所有類型檔案合計最多 12 個。 完整的 H3 系統由三個模組組成,分工明確。第一個模組為 H3-Context-IR,負責深入理解與提煉使用者輸入的多模態指令,並將其轉換為模型更容易處理的「上下文中間表示」(Context Intermediate Representation)。官方強調,這個步驟對最終輸出品質至關重要,建議開發者將 H3-Context-IR API 整合至生成流程,或參考提示詞指南自行建構上下文處理系統。 第二個模組為 H3-Base,它會根據 H3-Context-IR 產生的中間表示來生成音頻與影片,並輸出 768p 解析度的結果。第三個模組則是 H3-Regenerate-2K,它會將 768p 的初步生成結果連同原始上下文一同送回 H3,以 2K 解析度重新生成一次。這個設計不僅發揮了 H3 本身的生成能力,也充分利用原始輸入中蘊含的豐富資訊,從而產出細節更精準、視覺品質更佳的高解析度內容。 MiniMax H3 採用 MiniMax H3 Community License 授權釋出,目前已開放原始碼與模型權重,開發者可在 Hugging Face 平台上獲取相關資源。這項開源舉措預計將推動多模態影片生成技術的普及,讓更多研究人員與開發者能夠基於此模型進行二次開發或應用整合。

Related

相關文章

王慧文家族辦公室押注的AI版圖:從大模型到AI Agent

王慧文家族辦公室Lollapalooza Capital已投資24個AI項目,從大模型公司月之暗面到AI Agent創業公司蝴蝶效應,覆蓋AI基礎設施、內容生成、教育和硬體等產業鏈關鍵環節。這顯示其投資布局從早期的大模型能力競爭,逐漸轉向AI應用落地與生態建設。

剛剛

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek

MiniMax發布多模態生成模型H3,支援2K解析度、15秒影片生成,性能與Seedance 2.5相當,但定價僅每秒0.8元人民幣,具備價格競爭力。H3將開源,打破影片生成市場由閉源模型主導的局面,可私有化部署,有望取代部分傳統後製工序。

剛剛
鈦媒體生成式AI

微信、支付寶會給豆包手機“開門”嗎?AI手機背後的入口之爭

如果這些規則沒有明確,即使技術接口存在,超級App們也沒有動力把最有價值的部分交給一個可能架空自己的外部Agent。如果豆包遲遲無法拿到阿里和騰訊等企業的深度授權,字節並非完全沒有退路。相比其他公司,字節最大的優勢之一,是它本身已經擁有一套規模龐大的互聯網產品生態。在內容領域,字節擁有抖音和今日頭條;在辦公與創作領域,擁有飛書、剪映等工具;在消費場景中,抖音電商和抖音生活服務也已經形成了相當規模的商品和本地商戶供給。

剛剛
鈦媒體生成式AI

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek

MiniMax發布新一代多模態生成模型H3,支援2K解析度與原生雙聲道,性能與Seedance 2.5同級,但每秒定價僅0.8元人民幣,並宣布數日內開放模型權重。H3透過自研VAE與全模態理解管線降低算力成本,能一次生成含配音、字幕與動效的成片,可能取代部分傳統後期工序。此舉打破視頻生成市場由閉源模型主導的局面,為中小團隊與重視數據主權的B端客戶提供新選擇。

剛剛
IT之家生成式AI

阿里企業級 Agent 產品“千問辦公”開啟公測,集成最新旗艦模型 Qwen3.8

阿里巴巴企業級Agent產品「千問辦公」正式開啟公測,個人與企業用戶可透過官網體驗,並整合了QoderWork、MuleRun、悟空三款產品,成為業界首款同時支援桌面端、雲端與企業協同Agent的產品。該服務搭載最新旗艦模型Qwen3.8,並提供免費版、個人標準版、個人高級版及企業版等多種訂閱方案,其中個人標準版與高級版目前有8折優惠。

剛剛

AI寫的書潛入線下書店,“稿子工整得有點嚇人”

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦安徽最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作AI寫的書潛入線下書店,“稿子工整得有點嚇人”新週刊·2026年08月03日 10:36“我的文字來自我撫摸過的真實世界。AI只撫摸過我的文字。” 當下的AI,已經不僅僅是協作工具,甚至成了“槍手”。不僅在網文領域,傳統出版社也出現了大量內容由AI生成的現象。而且,AI生成內容正在“進化”,不像以往那麼易於辨認,為甄別它們增加了難度。 就讀者而言,他們不希望什麼東西都由AI代勞。“AI的加入或許能讓書的內容更完美,但同時也模糊了作者身上關於這個世界的信號。” “毫不掩飾AI的痕跡”“到底誰允許這種AI廢料出版的?” 近日,社科類圖書《飯圈紀實:愛、數據和權力》被讀者批評其內容大量使用AI生成。目前,該書在豆瓣的評分已跌至5.3分,評論區湧入大量差評。 有讀者指出,書中有大量意義不明的修辭和生硬表達,疑似AI生成,例如這一句:“這種認知鴻溝,恰如深海魚與飛鳥的對話——前者在高壓黑暗中守護微光,後者在晴空下卻無從想象那束光的分量”“她們通過三重維度,在虛擬與現實交織的縫隙裡,一磚一瓦地建造抵禦原子化孤獨的堡壘。” 豆瓣評論區截圖。(圖/豆瓣) 面對爭議,該書第一作者馬中紅回覆媒體:“實事求是地講,我們就沒有用AI寫作。

剛剛