天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek

重點摘要
MiniMax發布多模態生成模型H3,支援2K解析度、15秒影片生成,性能與Seedance 2.5相當,但定價僅每秒0.8元人民幣,具備價格競爭力。H3將開源,打破影片生成市場由閉源模型主導的局面,可私有化部署,有望取代部分傳統後製工序。
MiniMax 在 2026 年 8 月 3 日正式對外發表新一代多模態生成模型 H3,消息一出,港股 MiniMax 股價隨即上漲超過 10%,市值來到 249.4 港元。市場用實際行動為這場產品發布投下信任票,也讓外界重新聚焦這家公司在多模態領域的技術布局。H3 的定位是一款通用的全模態生成模型,能夠同時理解文字、圖像、影片與聲音組成的多模態上下文,並輸出具有原生雙聲道的音影片內容,最高支援 15 秒、2K 解析度的輸出。從官方釋出的早期實測影片來看,H3 的表現相當驚豔。
例如,使用者可以同時輸入一張人物參考圖、一段希區考克式鏡頭運鏡的參考影片,以及一條參考歌聲的音頻,模型就能理解「讓圖中人物按照參考影片的鏡頭運動,並用參考音頻中的歌聲唱歌」這類複合指令,直接生成一段帶有原生雙聲道的 2K 成品。這種跨模態的複合參考能力,過去曾是 Seedance 的招牌功能,如今 MiniMax 也將這項能力納入麾下。在權威的 Artificial Analysis 影片模型榜單中,截至 H3 發布當日,MiniMax H3 在影片編輯能力項目中排名全球第一,文生影片與圖生影片能力則分別位居第二與第三名,模型綜合實力已躋身全球第一梯隊。
H3 的另一個突出亮點是複雜文本的保持能力。在影視片頭的中英文標題、動態海報上的品牌 Logo,或是 UI 動效中的字幕等場景中,H3 能讓文字真正融入視覺構圖,文字不僅要貼合物體的透視,還要接受場景光源的照射方向,並隨著鏡頭運動與主體動作而變化。舉例來說,如果將一個品牌 Logo 放到玻璃杯上,模型需要理解玻璃的折射;放到牆上,則需理解牆面的曲率與紋理;跟隨鏡頭推拉時,還要保持字體形狀不變形。這已經超越了單純的「生成字體」技術邊界,而是模型對場景進行整體理解後的產物。除了性能表現,H3 的另一大特色是價格策略。MiniMax H3 的預設輸出解析度為 2K,每秒定價僅為 0.
8 元人民幣,在同級別的產品中具備極強的競爭力。過去半年,主流商用影片生成模型的預設解析度大多停留在 1080p 水平,H3 直接將門檻拉高到 2K。能夠支撐這樣價差的原因,在於 H3 自研的 VAE 技術(H3-VAE),這項技術將畫面的壓縮率提升到業界領先水準,同樣一段影片能用更少的區塊來表達,序列長度直接節省了 4 倍,訓練與推理成本都跟著降低。在高解析度處理上,業界大部分模型輸出 2K 或 4K 的方式,是先產生一版低解析度的畫面,再透過專門的超解析度模組放大畫面,但這個過程本質上是在「猜測」缺失的細節,導致小字、紋理或光影容易模糊或變形。
H3 則不把低解析度影片當作唯一依據,而是將其作為一種參考,連同原來的多模態上下文一起輸入模型,不僅能複用 H3 既有的生成能力,還能恢復低解析度影片中已經消失、但上下文裡仍然存在的資訊,這也是 H3 在複雜文字場景中不翻車的根本原因。換句話說,H3 走的是「用架構效率提升性能」的路線,透過技術創新降低算力消耗,這對商業化的重要意義在於,當算力成本進入壓縮通道,影片生成的毛利率天花板將會重新打開。H3 的能力邊界正在嘗試吃掉傳統後期軟體如 After Effects 或 Premiere 所代表的完整影片後期製作鏈條。
過去的 AI 影片模型,交付的往往只是一段沒有配音、沒有字幕、沒有包裝的畫面素材,剩下的工作必須由用戶在剪輯軟體中一步步完成。H3 的不同之處在於,它將後期處理整合進模型內部:理解創意意圖、生成主體畫面、匹配音效音樂、渲染字幕文字、完成動效包裝,一次生成,直接交付。例如,一個電商產品的廣告開場鏡頭,過去需要經歷「文生影片取得產品動態畫面 → TTS 合成旁白 → 剪映套用字幕模板 → AE 製作產品打光與價格數字跳動動效」等一系列流程。
但在 H3 的架構下,只要輸入一張產品圖與一段廣告腳本,它就能一次輸出包含上架運鏡、旁白配音、字幕、價格彈跳與光影氛圍的成品,而且每個視覺元素都與畫面的空間、光線與節奏對齊,並非簡單疊加。根據前期邀測回饋,H3 具備商用級的多場景內容生成能力,在指令遵循、文字與品牌資訊呈現、以及影片到影片的動作遷移等方面表現出色,可實現精準可控的多模態內容編輯與生成,廣泛適用於廣告、品牌、電商、產品設計、UI/UX 與遊戲等商業場景。參考 Adobe 2025 財年財報,創意雲業務全球收入約 145 億美元,其中影片後期類工具佔了相當比例;國內影片後期外包市場規模估算約在 300 至 500 億元人民幣區間。
如果 H3 的 AI 原生後期能力能在 B 端持續兌現,可能替代其中 10% 到 30% 的傳統後期工序。影片生成領域也迎來了首次旗艦級模型開源的時刻。在 H3 發布當天,MiniMax 就宣布將在數日內開放模型權重。過去,影片生成領域的預設選擇幾乎都是閉源模型,Seedance、可靈、Sora、Veo 等主流模型無一例外,理由很直接:影片模型訓練成本高、算力消耗大,閉源加上 API 計費是最直接的商業模式。
然而,過去一段時間,閉源模式也帶來了一些問題,例如部分頭部產品在短時間內多次調整價格,導致用戶使用成本波動劇烈;C 端產品與 B 端 API 之間存在定價倒掛的情況;企業級接入門檻高,中小團隊難以直接獲得官方 API 權限,甚至催生了拼單、轉售等灰色中間服務。這些現象的背後,反映的是閉源模式下少數廠商掌握定價權的失衡結構。開源模型的出現,可能改變這一格局,讓行業競爭從單一的技術比拼,轉向更開放的生態競爭。同時,一批原先被閉源模型擋在門外的高價值 B 端場景也得以打開。
影視公司不會把品牌角色形象或未發布劇集素材投入公有雲 API,廣告主無法接受品牌視覺每次生成時隨機漂移,遊戲公司的核心 IP 更不能交由第三方模型處理。H3 的模型開源加上可本地私有化部署的特性,正好能夠承接這些對數據主權有嚴格要求的客戶。對於港股 MiniMax 來說,H3 的意義不僅是又一款模型的發布。自今年 1 月上市以來,市場對這家公司的估值錨點不斷變化,情緒從高度期待轉為審慎觀望。H3 是這家公司在歷經起伏之後第一次主動出擊。雖然一個模型不會立刻改寫整個牌局,但它至少證明了一件事:MiniMax 仍有能力從頭翻轉一場遊戲。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。