天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek

重點摘要
MiniMax發布新一代多模態生成模型H3,支援2K解析度與原生雙聲道,性能與Seedance 2.5同級,但每秒定價僅0.8元人民幣,並宣布數日內開放模型權重。H3透過自研VAE與全模態理解管線降低算力成本,能一次生成含配音、字幕與動效的成片,可能取代部分傳統後期工序。此舉打破視頻生成市場由閉源模型主導的局面,為中小團隊與重視數據主權的B端客戶提供新選擇。
港股市場今日迎來一波明顯漲勢,MiniMax-W(00100.HK)股價一度衝高至249.4港元,漲幅超過10%,市場情緒高漲的背後,正是公司盤前正式發布新一代多模態生成模型H3。投資者以真金白銀為這次產品發布投下信任票,也讓外界重新聚焦這家從年初上市以來歷經估值波動的AI公司。 過去一段時間,視頻生成賽道長期由Seedance、可靈等少數頭部閉源模型主導,價格、算力消耗與生成效率始終是行業熱議的話題。用戶苦於閉源模型久矣,市場期待一個具備競爭力的新選項出現。MiniMax選擇在此刻推出H3,正是希望打破既有格局,為視頻生成市場注入全新變數。 根據官方發布的技術說明,H3定位為一款通用的全模態生成模型,具備對文本、圖像、視頻與聲音所組成的多模態上下文進行統一理解的能力,並能輸出原生雙聲道的音視頻內容,最高支援15秒、2K解析度輸出。在性能表現上,H3與Seedance 2.5被認為處於同一梯隊,而從早期邀測釋出的示範片段來看,效果相當亮眼。 舉例而言,使用者若提供一張人物參考圖、一段希區考克式鏡頭運動的參考影片,以及一條參考歌聲的音頻,H3能理解「讓圖中人物按照參考影片的鏡頭運動方式,並以參考音頻的歌聲演唱」這類複合指令,一次生成帶原生雙聲道的2K成片。這種跨模態複合參考能力,過去被視為Seedance的招牌技術,如今MiniMax也將這項能力納入自家模型。 在權威評測機構Artificial Analysis的影片模型榜單中,截至2026年7月31日H3發布當日,MiniMax H3在影片編輯能力項目排名全球第一,文生影片與圖生影片能力分別位居第二、第三名,綜合能力躋身全球第一梯隊。H3的另一大亮點是複雜文本保持能力,無論是影視片頭的中英文字標題、動態海報上的品牌Logo,還是UI動效中的字幕,H3都能讓文字真正參與視覺構圖,文字要貼合物體的透視角度、接受場景光源的方向,並跟隨鏡頭運動與主體動作自然變化。 舉例而言,將一個品牌Logo放到玻璃杯上,模型需要理解玻璃折射;放到牆上,則需理解牆面的曲率與紋理;鏡頭推拉時,字體形狀必須保持不變形。這已經超越單純「生成字體」的技術邊界,而是模型對場景進行整體理解後所產生的結果。複雜文本保持能力只是「更懂視覺、更懂世界」這套底層能力的其中一個顯性觀察點。根據MiniMax技術博客說明,H3的技術核心在於Contextual Omni Representation,也就是對上下文中的所有模態資訊及其相互關係進行組織,將整段素材視為統一上下文,為模型描述影片、音頻等多種元素的關聯,並為此搭建了專門的模型與全模態理解管線。 除了性能,H3也延續了MiniMax一貫「量大管飽」的定價策略。官方定價方面,H3預設2K解析度,每秒定價僅人民幣0.8元,在同級別解析度產品中具備明顯的價格競爭力。過去半年,行業內討論「電影級」影片生成時,主流商用模型的預設解析度多在1080p水準,H3直接將預設輸出解析度提升至2K,在高畫質化方向上邁出一步。 支撐這個價差的是H3背後的技術創新。影片生成模型訓練時,每一幀畫面都要被切割成小區塊餵給模型,區塊越多,訓練與推理成本越高。H3的自研VAE(H3-VAE)將畫面壓縮率做到產業領先水準,根據官方博客,同樣一段影片用更少的區塊表達,序列長度直接節省4倍,訓練成本與推理成本同步下降。在高解析度輸出方面,業界多數模型生成2K或4K的作法,是先產出一版低解析度畫面,再套用專門的超解析度模組放大,但這個模組本質上是在「猜測」缺失細節,因此放大後的小字、紋理、光影經常出現模糊或變形。H3則不把低解析度影片當作唯一依據,而是將其作為一種參考,連同原本的多模態上下文一起輸入模型,既能複用H3既有的生成能力,也能還原低解析度影片中已不可見、但上下文裡仍然存在的資訊,這正是H3在複雜文字場景如片頭、Logo、字幕中不翻車的底層原因。 換句話說,H3走的是「用架構效率提升性能」的路線,透過技術創新降低算力消耗。這條技術路徑對商業化的意義在於,當算力成本進入壓縮通道,影片生成的毛利率天花板將重新打開,為後續的商業拓展提供更大空間。 H3的能力正在逐步取代AE、Premiere等軟體所代表的影片後期製作鏈條。過去的AI影片模型交付的是一段「素材」,使用者拿到的往往只是沒有配音、沒有字幕、沒有包裝的畫面,剩餘工作必須自己在AE、Premiere、剪映等工具中一步一步完成。H3的不同之處在於,它把「後期」這件事裝進模型內部,理解創意意圖、生成主體畫面、匹配音效音樂、渲染字幕文字、完成動效包裝,一次生成直接交付。舉例來說,一個電商產品廣告的開場鏡頭,過去需要「文生影片取得產品在貨架上的動態畫面 → TTS合成『限時5折』旁白 → 剪映套字幕模板 → AE做產品打光高亮與價格數字彈跳動效」這一系列流程。到了H3,使用者只需輸入一張產品圖與一段廣告腳本,它一次輸出的成片就帶有貨架運鏡、旁白配音、字幕、價格彈跳、光影氛圍,每個視覺元素與畫面的空間、光線、節奏都對齊,而非簡單疊加。 根據前期邀測回饋,H3具備商用級多場景內容生成能力,在指令遵循、文字與品牌資訊呈現、V2V動作遷移等方面表現出色,可實現精準可控的多模態內容編輯與生成,廣泛適用於廣告、品牌、電商、產品設計、UI/UX、遊戲等商業場景。參考Adobe 2025財年財報,創意雲業務全球收入約145億美元,其中影片後製類工具佔相當比例;國內影片後製外包市場估算約在300至500億元人民幣區間。如果H3的AI原生後製能力在B端持續兌現,可能替代其中10%至30%的傳統後製工序。 MiniMax官方部落格中提到,「影片模型將能夠理解更完整的創作意圖,處理更複雜的內容需求,並逐步從『生成一段影片』,走向真正參與內容生產的全過程。」這讓人想起2011年之後的十年裡,Netflix吃掉了Blockbuster、Uber吃掉了計程車公司、Airbnb吃掉了連鎖飯店,技術能力的量變累積到某一刻會突然發生質變。軟體吃掉了那些不軟體的行業,現在,AI要吃掉那些不AI的軟體。 影片生成領域迎來旗艦開源時刻,就在H3發布當天,MiniMax宣布H3將在數日內開放模型權重。過去,影片生成領域的預設選項是閉源模型,Seedance、可靈、Sora、Veo,所有主流模型無一例外,理由很直接:影片模型訓練成本高、算力消耗大,閉源加API計費是最直接的商業模式。開源意味著行業不再是閉源模型獨大。 過去一段時間,影片生成行業整體由少數閉源模型主導,商業化路徑也基本圍繞「API計費+會員訂閱」展開。過程中,行業出現了一些值得關注的現象:部分頭部產品在短時間內多次調整價格體系,導致使用者成本波動較大;C端產品與B端API之間存在定價倒掛情況;企業級接入門檻較高,中小團隊往往難以直接取得官方API權限,由此催生拼單、轉售等灰色中間服務。這些現象背後,反映的是閉源模式下的商業化邏輯——當少數模型佔據技術優勢時,供給方有較強的定價權。而開源模型的出現,可能改變這個格局,讓行業競爭從單一技術比拼,轉向更開放的生態競爭。 閉源模型接不住的高價值B端場景也被打開了。影視公司往往不會把品牌角色形象、未發布劇集素材放進公有雲API,廣告主不會接受品牌視覺每次生成時隨機漂移,遊戲公司的核心IP不能上第三方模型。這批客戶過去被閉源模型的「資料主權」問題擋在門外,是影片生成商業化裡最貴、最有黏性、也最沒被服務的一批。H3的模型開源與可本地私有化部署,正好接住這批客戶。 影片生成這個賽道,過去半年被傲慢定義,漲價、排隊、白名單、拼盤、掮客、帳號倒賣,用戶在抱怨,市場在沉默,中小公司被擋在門外,B端客戶在糾結於資料與資產。這不是一個健康的市場,是一個失衡的市場。H3把這口氣放了出來。旗艦、2K、開源、0.8元/秒的單價,把商用起步價壓到主流模型的三分之一,把這一切遞給整個開發者生態、遞給中小公司。影片生成的開源時代,從7月31日開始。 對港股MiniMax來說,H3的意義不只是又一款模型的發布。1月上市以來,市場對這家公司的估值錨點在變,市場情緒從「神壇」到「審慎」。H3是這家公司在跌宕之後的第一次主動出招。牌桌不會因為一款模型就重排,但它至少證明了一件事:MiniMax還有能力從頭掀翻一場遊戲。
Related
相關文章

賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發!
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發! Jay 2026-08-03 12:29:44 來源:量子位 終究還是喜提了「美國豆包」 Jay 發自 凹非寺 量子位 | 公眾號 QbitAI 啥,谷歌真比OpenAI還早一年搞出了ChatGPT? 不是谷歌事後找補了,這次是OpenAI自己人,Codex負責人Tibo剛佐證的消息: 那就是早一年版的ChatGPT。最初叫LMChat,後來又換了另一個代號。 谷歌太緊張了,不敢發佈它,而DeepMind則被禁止推出可能衝擊谷歌業務的產品。 但Tibo為啥對這段陳年舊事如此瞭如指掌? 答案是:他當時就在那支谷歌團隊裡。 我當時就是那個團隊的一員。 是的,如今為OpenAI打造「無限Token」的Tibo,正是當年穀歌那個項目的親歷者。 網友都震驚了,Tibo還有這麼一段經歷: 不er,我還以為你只是個Codex的重置按鈕(bushi)。 Jeff Dean:我不甘心啊!! 事情是這樣的,一名Midjourney工程師,最近在X上翻出了前谷歌大腦負責人Jeff Dean的一段舊採訪: 我有時會想Jeff Dean的那次採訪,他說他們在ChatGPT之前就有一個內部的Chatbot,但覺得用它還不如直接用谷歌搜索。 沒想到Tibo親自下場回覆,和Jeff Dean來了波隔空對話: Jeff說的那個項目確實存在,最初叫LMChat,幾乎就是一個早了一年的ChatGPT。 至於為啥沒發出來,Tibo無奈地表示,DeepMind沒這權限啊,LLM會衝擊谷歌搜索,老闆們緊張壞了,不給拍板。

生成模型也能端到端訓練了?核心竟是一個for循環
2012年,AlexNet以一場壓倒性的勝利終結了一個時代。在此之前,圖像識別依賴於人工精心設計的一層層特徵提取流程;AlexNet則證明了一件後來被反覆驗證的事:將整個任務端到端地交給模型自己學習,幾乎總能勝過人類設計的分階段流水線。從圖像分類到目標檢測再到圖像分割,深度學習的每一次躍遷背後,都離不開「讓它自己一口氣學完」這個核心思路。 然而,有一個領域始終是例外:生成模型。當今最強、最具擴展性的生成模型,無論是自迴歸還是擴散模型,都不是端到端的。

數百萬本書,被Claude “閱後即焚”
Anthropic為了讓AI讀完人類的書籍,採取了特殊做法,先讓這些書不再以書的形式存在。此舉涉及數百萬本書,透過「閱後即焚」的方式處理,以利AI進行閱讀與學習。

王慧文家族辦公室押注的AI版圖:從大模型到AI Agent
王慧文家族辦公室Lollapalooza Capital已投資24個AI項目,從大模型公司月之暗面到AI Agent創業公司蝴蝶效應,覆蓋AI基礎設施、內容生成、教育和硬體等產業鏈關鍵環節。這顯示其投資布局從早期的大模型能力競爭,逐漸轉向AI應用落地與生態建設。

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek
MiniMax發布多模態生成模型H3,支援2K解析度、15秒影片生成,性能與Seedance 2.5相當,但定價僅每秒0.8元人民幣,具備價格競爭力。H3將開源,打破影片生成市場由閉源模型主導的局面,可私有化部署,有望取代部分傳統後製工序。

微信、支付寶會給豆包手機“開門”嗎?AI手機背後的入口之爭
如果這些規則沒有明確,即使技術接口存在,超級App們也沒有動力把最有價值的部分交給一個可能架空自己的外部Agent。如果豆包遲遲無法拿到阿里和騰訊等企業的深度授權,字節並非完全沒有退路。相比其他公司,字節最大的優勢之一,是它本身已經擁有一套規模龐大的互聯網產品生態。在內容領域,字節擁有抖音和今日頭條;在辦公與創作領域,擁有飛書、剪映等工具;在消費場景中,抖音電商和抖音生活服務也已經形成了相當規模的商品和本地商戶供給。