天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek

重點摘要
MiniMax發布多模態生成模型H3,支援2K解析度、15秒影片生成,性能與Seedance 2.5相當,但定價僅每秒0.8元人民幣,具備價格競爭力。H3將開源,打破影片生成市場由閉源模型主導的局面,可私有化部署,有望取代部分傳統後製工序。
MiniMax 在 2026 年 8 月 3 日正式對外發表新一代多模態生成模型 H3,消息一出,港股 MiniMax 股價隨即上漲超過 10%,市值來到 249.4 港元。市場用實際行動為這場產品發布投下信任票,也讓外界重新聚焦這家公司在多模態領域的技術布局。 H3 的定位是一款通用的全模態生成模型,能夠同時理解文字、圖像、影片與聲音組成的多模態上下文,並輸出具有原生雙聲道的音影片內容,最高支援 15 秒、2K 解析度的輸出。從官方釋出的早期實測影片來看,H3 的表現相當驚豔。例如,使用者可以同時輸入一張人物參考圖、一段希區考克式鏡頭運鏡的參考影片,以及一條參考歌聲的音頻,模型就能理解「讓圖中人物按照參考影片的鏡頭運動,並用參考音頻中的歌聲唱歌」這類複合指令,直接生成一段帶有原生雙聲道的 2K 成品。這種跨模態的複合參考能力,過去曾是 Seedance 的招牌功能,如今 MiniMax 也將這項能力納入麾下。 在權威的 Artificial Analysis 影片模型榜單中,截至 H3 發布當日,MiniMax H3 在影片編輯能力項目中排名全球第一,文生影片與圖生影片能力則分別位居第二與第三名,模型綜合實力已躋身全球第一梯隊。H3 的另一個突出亮點是複雜文本的保持能力。在影視片頭的中英文標題、動態海報上的品牌 Logo,或是 UI 動效中的字幕等場景中,H3 能讓文字真正融入視覺構圖,文字不僅要貼合物體的透視,還要接受場景光源的照射方向,並隨著鏡頭運動與主體動作而變化。舉例來說,如果將一個品牌 Logo 放到玻璃杯上,模型需要理解玻璃的折射;放到牆上,則需理解牆面的曲率與紋理;跟隨鏡頭推拉時,還要保持字體形狀不變形。這已經超越了單純的「生成字體」技術邊界,而是模型對場景進行整體理解後的產物。 除了性能表現,H3 的另一大特色是價格策略。MiniMax H3 的預設輸出解析度為 2K,每秒定價僅為 0.8 元人民幣,在同級別的產品中具備極強的競爭力。過去半年,主流商用影片生成模型的預設解析度大多停留在 1080p 水平,H3 直接將門檻拉高到 2K。能夠支撐這樣價差的原因,在於 H3 自研的 VAE 技術(H3-VAE),這項技術將畫面的壓縮率提升到業界領先水準,同樣一段影片能用更少的區塊來表達,序列長度直接節省了 4 倍,訓練與推理成本都跟著降低。 在高解析度處理上,業界大部分模型輸出 2K 或 4K 的方式,是先產生一版低解析度的畫面,再透過專門的超解析度模組放大畫面,但這個過程本質上是在「猜測」缺失的細節,導致小字、紋理或光影容易模糊或變形。H3 則不把低解析度影片當作唯一依據,而是將其作為一種參考,連同原來的多模態上下文一起輸入模型,不僅能複用 H3 既有的生成能力,還能恢復低解析度影片中已經消失、但上下文裡仍然存在的資訊,這也是 H3 在複雜文字場景中不翻車的根本原因。換句話說,H3 走的是「用架構效率提升性能」的路線,透過技術創新降低算力消耗,這對商業化的重要意義在於,當算力成本進入壓縮通道,影片生成的毛利率天花板將會重新打開。 H3 的能力邊界正在嘗試吃掉傳統後期軟體如 After Effects 或 Premiere 所代表的完整影片後期製作鏈條。過去的 AI 影片模型,交付的往往只是一段沒有配音、沒有字幕、沒有包裝的畫面素材,剩下的工作必須由用戶在剪輯軟體中一步步完成。H3 的不同之處在於,它將後期處理整合進模型內部:理解創意意圖、生成主體畫面、匹配音效音樂、渲染字幕文字、完成動效包裝,一次生成,直接交付。例如,一個電商產品的廣告開場鏡頭,過去需要經歷「文生影片取得產品動態畫面 → TTS 合成旁白 → 剪映套用字幕模板 → AE 製作產品打光與價格數字跳動動效」等一系列流程。但在 H3 的架構下,只要輸入一張產品圖與一段廣告腳本,它就能一次輸出包含上架運鏡、旁白配音、字幕、價格彈跳與光影氛圍的成品,而且每個視覺元素都與畫面的空間、光線與節奏對齊,並非簡單疊加。 根據前期邀測回饋,H3 具備商用級的多場景內容生成能力,在指令遵循、文字與品牌資訊呈現、以及影片到影片的動作遷移等方面表現出色,可實現精準可控的多模態內容編輯與生成,廣泛適用於廣告、品牌、電商、產品設計、UI/UX 與遊戲等商業場景。參考 Adobe 2025 財年財報,創意雲業務全球收入約 145 億美元,其中影片後期類工具佔了相當比例;國內影片後期外包市場規模估算約在 300 至 500 億元人民幣區間。如果 H3 的 AI 原生後期能力能在 B 端持續兌現,可能替代其中 10% 到 30% 的傳統後期工序。 影片生成領域也迎來了首次旗艦級模型開源的時刻。在 H3 發布當天,MiniMax 就宣布將在數日內開放模型權重。過去,影片生成領域的預設選擇幾乎都是閉源模型,Seedance、可靈、Sora、Veo 等主流模型無一例外,理由很直接:影片模型訓練成本高、算力消耗大,閉源加上 API 計費是最直接的商業模式。然而,過去一段時間,閉源模式也帶來了一些問題,例如部分頭部產品在短時間內多次調整價格,導致用戶使用成本波動劇烈;C 端產品與 B 端 API 之間存在定價倒掛的情況;企業級接入門檻高,中小團隊難以直接獲得官方 API 權限,甚至催生了拼單、轉售等灰色中間服務。這些現象的背後,反映的是閉源模式下少數廠商掌握定價權的失衡結構。 開源模型的出現,可能改變這一格局,讓行業競爭從單一的技術比拼,轉向更開放的生態競爭。同時,一批原先被閉源模型擋在門外的高價值 B 端場景也得以打開。影視公司不會把品牌角色形象或未發布劇集素材投入公有雲 API,廣告主無法接受品牌視覺每次生成時隨機漂移,遊戲公司的核心 IP 更不能交由第三方模型處理。H3 的模型開源加上可本地私有化部署的特性,正好能夠承接這些對數據主權有嚴格要求的客戶。對於港股 MiniMax 來說,H3 的意義不僅是又一款模型的發布。自今年 1 月上市以來,市場對這家公司的估值錨點不斷變化,情緒從高度期待轉為審慎觀望。H3 是這家公司在歷經起伏之後第一次主動出擊。雖然一個模型不會立刻改寫整個牌局,但它至少證明了一件事:MiniMax 仍有能力從頭翻轉一場遊戲。
Related
相關文章

賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發!
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發! Jay 2026-08-03 12:29:44 來源:量子位 終究還是喜提了「美國豆包」 Jay 發自 凹非寺 量子位 | 公眾號 QbitAI 啥,谷歌真比OpenAI還早一年搞出了ChatGPT? 不是谷歌事後找補了,這次是OpenAI自己人,Codex負責人Tibo剛佐證的消息: 那就是早一年版的ChatGPT。最初叫LMChat,後來又換了另一個代號。 谷歌太緊張了,不敢發佈它,而DeepMind則被禁止推出可能衝擊谷歌業務的產品。 但Tibo為啥對這段陳年舊事如此瞭如指掌? 答案是:他當時就在那支谷歌團隊裡。 我當時就是那個團隊的一員。 是的,如今為OpenAI打造「無限Token」的Tibo,正是當年穀歌那個項目的親歷者。 網友都震驚了,Tibo還有這麼一段經歷: 不er,我還以為你只是個Codex的重置按鈕(bushi)。 Jeff Dean:我不甘心啊!! 事情是這樣的,一名Midjourney工程師,最近在X上翻出了前谷歌大腦負責人Jeff Dean的一段舊採訪: 我有時會想Jeff Dean的那次採訪,他說他們在ChatGPT之前就有一個內部的Chatbot,但覺得用它還不如直接用谷歌搜索。 沒想到Tibo親自下場回覆,和Jeff Dean來了波隔空對話: Jeff說的那個項目確實存在,最初叫LMChat,幾乎就是一個早了一年的ChatGPT。 至於為啥沒發出來,Tibo無奈地表示,DeepMind沒這權限啊,LLM會衝擊谷歌搜索,老闆們緊張壞了,不給拍板。

生成模型也能端到端訓練了?核心竟是一個for循環
2012年,AlexNet以一場壓倒性的勝利終結了一個時代。在此之前,圖像識別依賴於人工精心設計的一層層特徵提取流程;AlexNet則證明了一件後來被反覆驗證的事:將整個任務端到端地交給模型自己學習,幾乎總能勝過人類設計的分階段流水線。從圖像分類到目標檢測再到圖像分割,深度學習的每一次躍遷背後,都離不開「讓它自己一口氣學完」這個核心思路。 然而,有一個領域始終是例外:生成模型。當今最強、最具擴展性的生成模型,無論是自迴歸還是擴散模型,都不是端到端的。

數百萬本書,被Claude “閱後即焚”
Anthropic為了讓AI讀完人類的書籍,採取了特殊做法,先讓這些書不再以書的形式存在。此舉涉及數百萬本書,透過「閱後即焚」的方式處理,以利AI進行閱讀與學習。

王慧文家族辦公室押注的AI版圖:從大模型到AI Agent
王慧文家族辦公室Lollapalooza Capital已投資24個AI項目,從大模型公司月之暗面到AI Agent創業公司蝴蝶效應,覆蓋AI基礎設施、內容生成、教育和硬體等產業鏈關鍵環節。這顯示其投資布局從早期的大模型能力競爭,逐漸轉向AI應用落地與生態建設。

微信、支付寶會給豆包手機“開門”嗎?AI手機背後的入口之爭
如果這些規則沒有明確,即使技術接口存在,超級App們也沒有動力把最有價值的部分交給一個可能架空自己的外部Agent。如果豆包遲遲無法拿到阿里和騰訊等企業的深度授權,字節並非完全沒有退路。相比其他公司,字節最大的優勢之一,是它本身已經擁有一套規模龐大的互聯網產品生態。在內容領域,字節擁有抖音和今日頭條;在辦公與創作領域,擁有飛書、剪映等工具;在消費場景中,抖音電商和抖音生活服務也已經形成了相當規模的商品和本地商戶供給。

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek
MiniMax發布新一代多模態生成模型H3,支援2K解析度與原生雙聲道,性能與Seedance 2.5同級,但每秒定價僅0.8元人民幣,並宣布數日內開放模型權重。H3透過自研VAE與全模態理解管線降低算力成本,能一次生成含配音、字幕與動效的成片,可能取代部分傳統後期工序。此舉打破視頻生成市場由閉源模型主導的局面,為中小團隊與重視數據主權的B端客戶提供新選擇。