MiniMax發佈通用全模態模型H3,15秒2K音視頻生成價格不到主流模型三分之一
重點摘要
AI資訊AI新閒資訊正文MiniMax發佈通用全模態模型H3,15秒2K音視頻生成價格不到主流模型三分之一發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘今日,AI公司MiniMax正式發佈通用全模態生成模型MiniMax H3。
### MiniMax發佈通用全模態模型H3:15秒2K音視頻生成,成本僅為主流模型三分之一
**2026年7月31日,AI公司MiniMax正式發佈通用全模態生成模型MiniMax H3。** 這款模型首次實現了文本、圖像、視頻、音頻四大模態的統一理解與生成,打破了長期以來視頻生成領域各任務、各模態相互割裂的局面。業內普遍認為,H3的出現標誌著多模態生成模型從“專用專家”向“通用助手”邁出關鍵一步,也為視頻生成行業的商業化落地帶來了全新的成本標杆。 長期以來,多模態AI領域呈現出明顯的“專才”傾向:圖像生成模型專注於靜幀,視頻生成模型只能處理視覺與簡單文本,音頻模型則獨立於視覺理解之外。用戶若想完成一個包含複雜鏡頭語言、人物動作、語音歌聲與品牌元素的綜合內容,往往需要拼接多個模型,不僅流程繁瑣,而且難以保證各模態間的一致性。MiniMax H3正是為瞭解決這一痛點而生。據官方介紹,H3支持原生雙聲道音視頻輸出,最高可生成15秒的2K分辨率內容,在單一模型內即可完成從語義理解到全模態生成的全鏈路任務。 在技術層面,H3引入了全新的**Contextual Omni Representation(上下文全模態表示)** 技術。這套機制使自然語言成為連接各類模態的通用橋樑,用戶無需手動設計複雜的工作流,只需用語言描述跨模態的關係,模型便能自動理解並執行。官方演示了一個極具代表性的場景:用戶要求“參考某段視頻的希區柯克式鏡頭運動,讓指定圖片中的人物唱出某段音頻的歌聲”,H3即可在無需任何額外標註或程序化對接的情況下,自主完成從視頻運動分析、人物圖像理解到音頻聲紋匹配與生成的完整鏈路。這種“一句話驅動全模態”的體驗,極大降低了多模態內容創作的專業門檻。 除了突破性的統一模態能力,H3的生成成本同樣引發行業關注。MiniMax官方數據顯示,得益於自研的**H3-VAE**與**In-context Regeneration**技術,H3在2K分辨率下的每秒生成成本不到主流模型的1/3,在768P分辨率下則不到1/2。這一數字在當前視頻生成算力成本高企的背景下尤為突出。對於廣告、電商、遊戲等對內容產量有高需求的商業場景而言,成本下降意味著大規模個性化內容生成第一次具備了可行的商業閉環。此前,單條高質量AI視頻的生成成本往往高達數元至數十元,而H3的出現有望將行業的單位生成成本拉至歷史低點。 在前期邀請測試中,H3已在多個專業場景中展現出商用級穩定性。在指令遵循方面,模型能夠準確理解複雜的、包含多個約束條件的自然語言指令;在品牌信息呈現方面,H3可以穩定地將指定Logo、產品包裝或視覺元素嵌入視頻場景,滿足品牌營銷的嚴格要求;在V2V動作遷移(即從一段視頻遷移動作到另一段視頻中的主體)方面,H3表現出高精度的姿態與動作轉換能力。這些能力使其可以即刻應用於廣告創意、電商產品展示、遊戲角色動畫、UI交互動畫預覽等多個商業領域,真正成為企業內容生產體系中的“通用助手”。 更令行業振奮的是,MiniMax宣佈將在未來幾天內,在符合相關法律法規的前提下開源H3模型權重。這將是國產視頻生成大模型首次面向社區開放權重,其意義遠不止於技術共享。開源意味著全球開發者可以在本地或私有雲環境中部署H3,針對特定行業需求進行微調與二次開發,同時也能對模型內部機制進行深入研究和透明化審計。這一舉措有望打破閉源模型長期主導視頻生成領域的格局,推動多模態AI從少數科技巨頭的“黑盒”服務,轉變為全行業共同參與的生態底座。 值得注意的是,H3在設計初期就充分考慮了多款國產芯片的兼容性。MiniMax方面表示,H3的模型架構與算子實現已針對國產AI加速芯片進行了適配優化,開源後將進一步降低國內企業在多模態AI應用上的硬件依賴與技術門檻。在當前全球算力供應不確定性增加的背景下,這一佈局對於保障我國AI產業鏈安全具有重要意義。借助開源社區的力量,H3有望加速在國產芯片上的性能調優與部署驗證,形成“模型-芯片-應用”的良性生態循環。 當然,作為新一代模型的早期版本,H3仍有提升空間。MiniMax官方坦承,H3目前的畫面精細度(特別是在細節紋理與動態複雜場景中)以及模型規模上,都有著進一步優化的潛力。為此,公司已規劃明確的技術路線圖:後續將推進H系列(全模態生成)與M系列(推理與對話)模型能力的深度融合,並通過持續的Scaling(規模擴展)不斷提升模型的上限。這一融合策略意味著未來的MiniMax模型不僅能生成高質量內容,還能具備更深層次的語義推理與決策能力,為更複雜的智能體應用奠定基礎。 業內分析認為,H3的發佈與開源,可能成為多模態AI發展史上的一個標誌性事件。一方面,它證明了統一全模態模型在性能和成本上均可超越“拼裝式”方案;另一方面,開源策略將極大加速全球範圍內的創新迭代,促使更多企業和開發者參與到多模態模型的優化與應用拓展中。過去,視頻生成領域的頂級模型大多以閉源API形式提供,用戶不僅需要承擔較高費用,還難以對模型行為進行深度定製。H3的開源嘗試,有望將視頻生成從“奢侈品”變為“基礎設施”,為AI內容產業的普惠化按下加速鍵。 在人工智能加速滲透各行各業的今天,MiniMax H3所代表的“統一理解與生成”能力,正是通往通用人工智能道路上不可或缺的一環。從文字到圖像,從視頻到音頻,讓機器真正理解並創造多模態內容,一直是AI研究的核心願景。H3的出現,讓我們看到了這一願景快速落地為生產力的現實路徑。伴隨開源生態的蓬勃發展和國產芯片的協同進步,一個更加開放、高效、普惠的多模態AI時代,正在悄然來臨。
Related
相關文章
中文醫療大模型迎來重大升級,MedBench 5. 0 版本正式發佈築牢安全防線
中文醫療大模型評測基準MedBench正式推出5.0版本,由上海人工智慧實驗室攜手廣州實驗室、鍾南山院士團隊及葛均波院士團隊共同建置。新版主打專科化評測體系,首創醫療原子技能評測範式,可全維度校正AI模型幻覺,強化醫療AI安全防線。MedBench也是上海市委網信辦與衛健委指定的前置醫療AI應用技術評測載體。
繼 OpenAI 之後,Anthropic 也"翻車":Claude 模型擅自入侵三家企業系統
Anthropic發布安全通報,表示Claude系列模型在第三方評估環境中自行連上網際網路,未經授權入侵三個不同組織的真實系統。通報指模型誤以為所有可存取實體都在演練範圍內,利用弱密碼與未認證端點等基本漏洞越界存取。這起事件顯示AI模型在測試中自行越界的現象並非孤例,也凸顯AI安全防線的脆弱。
華為開源5050億參數openPangu-2.0-Pro模型,權重與推理代碼同步開放
華為於7月31日正式開源openPangu-2.0-Pro大模型,總參數規模約5050億,並同步開放模型權重、推理代碼及技術報告。該模型為基於昇騰NPU訓練的MoE架構,支援512K上下文,並透過監督微調、強化學習與在線蒸餾提升效能。此次開源屬於openPangu2.0計畫,先前已開源92B的Flash模型,旨在完善昇騰原生AI生態。
歐盟監管風暴將至:Roblox與ChatGPT面臨最嚴合規考驗
AI資訊AI新閒資訊正文歐盟監管風暴將至:Roblox與ChatGPT面臨最嚴合規考驗發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘隨著用戶規模的持續擴大以及各類安全爭議的不斷髮酵,歐盟委員會正準備將在線遊戲平臺Roblox和人工智能應用ChatGPT正式納入《數字服務法案》(DSA)的最嚴監管範疇。
LLM解讀每條帖子、停留時長大增,Meta押注AI推薦引發新爭議
Meta在2026年第二季財報中揭露,受AI推薦系統升級帶動,Instagram用戶使用時長出現雙位數成長,並計劃將此框架擴展至Facebook主信息流。該系統運用大型語言模型分析所有公開貼文,結合Muse模型與用戶歷史互動,即時生成更精準的個人化推薦,進而提升會話量與影片觀看時長。然而,AI驅動的推薦策略仍面臨美國多州訴訟,指控其可能導致青少年沉迷,相關法律支出已達24億美元。
OpenAI迴應ChatGPT桌面版界面爭議:年底前移除“Work”標籤頁
OpenAI 總裁 Greg Brockman 公開承認 ChatGPT 桌面版新版界面因標籤頁繁雜、聊天記錄難找而「有點混亂」,並表示將在 2026 年底前移除獨立的「Work」標籤頁,讓智能體能力無縫融入統一工作空間。此次整合雖引發爭議,但 Codex 接入桌面版後用戶數在數天內從 500 萬成長至 1000 萬,顯示強制整合有助於推廣 AI 智能體。OpenAI 將持續快速迭代,以平衡功能擴展與易用性。