MiniMax發佈通用全模態模型H3,15秒2K音視頻生成價格不到主流模型三分之一

2026年7月31日 02:006800 次瀏覽

重點摘要

AI資訊AI新閒資訊正文MiniMax發佈通用全模態模型H3,15秒2K音視頻生成價格不到主流模型三分之一發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘今日,AI公司MiniMax正式發佈通用全模態生成模型MiniMax H3。

站內 AI 整理稿

### MiniMax發佈通用全模態模型H3:15秒2K音視頻生成,成本僅為主流模型三分之一

**2026年7月31日,AI公司MiniMax正式發佈通用全模態生成模型MiniMax H3。** 這款模型首次實現了文本、圖像、視頻、音頻四大模態的統一理解與生成,打破了長期以來視頻生成領域各任務、各模態相互割裂的局面。業內普遍認為,H3的出現標誌著多模態生成模型從“專用專家”向“通用助手”邁出關鍵一步,也為視頻生成行業的商業化落地帶來了全新的成本標杆。長期以來,多模態AI領域呈現出明顯的“專才”傾向:圖像生成模型專注於靜幀,視頻生成模型只能處理視覺與簡單文本,音頻模型則獨立於視覺理解之外。

用戶若想完成一個包含複雜鏡頭語言、人物動作、語音歌聲與品牌元素的綜合內容,往往需要拼接多個模型,不僅流程繁瑣,而且難以保證各模態間的一致性。MiniMax H3正是為瞭解決這一痛點而生。據官方介紹,H3支持原生雙聲道音視頻輸出,最高可生成15秒的2K分辨率內容,在單一模型內即可完成從語義理解到全模態生成的全鏈路任務。在技術層面,H3引入了全新的**Contextual Omni Representation(上下文全模態表示)** 技術。這套機制使自然語言成為連接各類模態的通用橋樑,用戶無需手動設計複雜的工作流,只需用語言描述跨模態的關係,模型便能自動理解並執行。

官方演示了一個極具代表性的場景:用戶要求“參考某段視頻的希區柯克式鏡頭運動,讓指定圖片中的人物唱出某段音頻的歌聲”,H3即可在無需任何額外標註或程序化對接的情況下,自主完成從視頻運動分析、人物圖像理解到音頻聲紋匹配與生成的完整鏈路。這種“一句話驅動全模態”的體驗,極大降低了多模態內容創作的專業門檻。除了突破性的統一模態能力,H3的生成成本同樣引發行業關注。MiniMax官方數據顯示,得益於自研的**H3-VAE**與**In-context Regeneration**技術,H3在2K分辨率下的每秒生成成本不到主流模型的1/3,在768P分辨率下則不到1/2。

這一數字在當前視頻生成算力成本高企的背景下尤為突出。對於廣告、電商、遊戲等對內容產量有高需求的商業場景而言,成本下降意味著大規模個性化內容生成第一次具備了可行的商業閉環。此前,單條高質量AI視頻的生成成本往往高達數元至數十元,而H3的出現有望將行業的單位生成成本拉至歷史低點。在前期邀請測試中,H3已在多個專業場景中展現出商用級穩定性。

在指令遵循方面,模型能夠準確理解複雜的、包含多個約束條件的自然語言指令;在品牌信息呈現方面,H3可以穩定地將指定Logo、產品包裝或視覺元素嵌入視頻場景,滿足品牌營銷的嚴格要求;在V2V動作遷移(即從一段視頻遷移動作到另一段視頻中的主體)方面,H3表現出高精度的姿態與動作轉換能力。這些能力使其可以即刻應用於廣告創意、電商產品展示、遊戲角色動畫、UI交互動畫預覽等多個商業領域,真正成為企業內容生產體系中的“通用助手”。更令行業振奮的是,MiniMax宣佈將在未來幾天內,在符合相關法律法規的前提下開源H3模型權重。這將是國產視頻生成大模型首次面向社區開放權重,其意義遠不止於技術共享。

開源意味著全球開發者可以在本地或私有雲環境中部署H3,針對特定行業需求進行微調與二次開發,同時也能對模型內部機制進行深入研究和透明化審計。這一舉措有望打破閉源模型長期主導視頻生成領域的格局,推動多模態AI從少數科技巨頭的“黑盒”服務,轉變為全行業共同參與的生態底座。值得注意的是,H3在設計初期就充分考慮了多款國產芯片的兼容性。MiniMax方面表示,H3的模型架構與算子實現已針對國產AI加速芯片進行了適配優化,開源後將進一步降低國內企業在多模態AI應用上的硬件依賴與技術門檻。在當前全球算力供應不確定性增加的背景下,這一佈局對於保障我國AI產業鏈安全具有重要意義。

借助開源社區的力量,H3有望加速在國產芯片上的性能調優與部署驗證,形成“模型-芯片-應用”的良性生態循環。當然,作為新一代模型的早期版本,H3仍有提升空間。MiniMax官方坦承,H3目前的畫面精細度(特別是在細節紋理與動態複雜場景中)以及模型規模上,都有著進一步優化的潛力。為此,公司已規劃明確的技術路線圖:後續將推進H系列(全模態生成)與M系列(推理與對話)模型能力的深度融合,並通過持續的Scaling(規模擴展)不斷提升模型的上限。這一融合策略意味著未來的MiniMax模型不僅能生成高質量內容,還能具備更深層次的語義推理與決策能力,為更複雜的智能體應用奠定基礎。

業內分析認為,H3的發佈與開源,可能成為多模態AI發展史上的一個標誌性事件。一方面,它證明了統一全模態模型在性能和成本上均可超越“拼裝式”方案;另一方面,開源策略將極大加速全球範圍內的創新迭代,促使更多企業和開發者參與到多模態模型的優化與應用拓展中。過去,視頻生成領域的頂級模型大多以閉源API形式提供,用戶不僅需要承擔較高費用,還難以對模型行為進行深度定製。H3的開源嘗試,有望將視頻生成從“奢侈品”變為“基礎設施”,為AI內容產業的普惠化按下加速鍵。在人工智能加速滲透各行各業的今天,MiniMax H3所代表的“統一理解與生成”能力,正是通往通用人工智能道路上不可或缺的一環。

從文字到圖像,從視頻到音頻,讓機器真正理解並創造多模態內容,一直是AI研究的核心願景。H3的出現,讓我們看到了這一願景快速落地為生產力的現實路徑。伴隨開源生態的蓬勃發展和國產芯片的協同進步,一個更加開放、高效、普惠的多模態AI時代,正在悄然來臨。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

3 小時前