智東西生成式AI

2K畫質,三成價格!錢包友好型國產視頻模型來了

2026年7月31日 05:46

重點摘要

智東西 作者 | 楊京麗 編輯 | 李水青 智東西7月31日報道,今日,MiniMax發佈通用全模態生成模型MiniMax H3。該模型能夠統一理解文本、圖像、視頻和聲音,並生成帶原生雙聲道的音視頻,最高支持15秒、2K分辨率輸出。 MiniMax稱,該模型在指令遵循、文字與品牌信息呈現、視頻到視頻動作遷移(V2V Motion Transfer)等方面表現出色,可用於廣告、品牌、電商、產品設計、UI/UX和遊戲等場景。

站內 AI 整理稿

**2K畫質,三成價格!錢包友好型國產視頻模型來了**

今日(7月31日),中國AI初創公司MiniMax正式推出通用全模態生成模型MiniMax H3。這款模型不僅能同時理解文本、圖像、視頻與聲音,還能直接生成帶有原生雙聲道音效的完整音視頻內容,最高支援15秒長度、2K解析度輸出,在畫質與成本之間取得驚人平衡。MiniMax表示,H3在指令遵循、文字與品牌資訊的精準呈現,以及影片到影片的動作遷移(V2V Motion Transfer)等方面表現突出,可廣泛應用於廣告製作、品牌行銷、電商商品展示、產品設計、UI/UX開發與遊戲場景。

相較於市場上主流模型,MiniMax宣稱提供業界最優的性價比:在2K解析度下,每秒生成價格不到主流模型的三分之一;在768P解析度下,價格更不到二分之一。不過,具體定價尚未公開。在第三方評測機構Artificial Analysis發布的文生視頻有聲榜單中,MiniMax H3位居第二,Elo評分為1242分,僅次於Google Gemini Omni Flash的1245分,競爭力相當強勁。MiniMax也透露,計畫在未來幾天內,於符合相關法律法規的前提下,開放模型權重,推動開源生態與國產晶片的適配,進一步降低使用門檻。**多模態融合創作:一次輸入參考影片、圖片與聲音**

真實世界的創作往往需要融合不同類型的資訊。MiniMax H3允許用戶在創作時同時輸入參考影片、人物圖片與聲音樣本,並要求模型執行複雜的跨模態任務。官方展示的案例中,用戶要求模型:「參考影片1的希區考克鏡頭運動,讓圖2中的人物唱歌,歌聲參考音頻3。」H3能分別從參考影片中提取鏡頭運動軌跡、從圖片中辨識人物身份、從音頻中提取聲音特徵,再根據自然語言描述,將這些元素無縫組合成全新的動態影片。 這種「一鍵融合」的能力,大幅簡化了傳統後製流程。過去需要專業剪輯師、動畫師與音效設計師協作才能完成的複雜效果,現在只需一段文字指令與幾份參考素材,就能在短時間內自動生成,對中小型電商、獨立品牌與新創團隊尤其具有吸引力。 **價格競爭力:重新定義高畫質生成門檻**

當前市場上主流的文生影片模型,如OpenAI的Sora、Google的Gemini系列等,雖然能生成高解析度內容,但成本往往居高不下,讓許多中小企業卻步。MiniMax H3以「2K畫質、三成價格」的策略切入,直接挑戰既有定價邏輯。在2K解析度下,每秒生成價格不到主流模型的1/3,意味著同樣預算可產出三倍時長的影片;在768P解析度下,價格更僅為主流模型的一半,對需要大量產出社群短影片、商品展示的用戶來說,成本優勢極為明顯。 儘管具體定價尚未公布,但MiniMax已明確表示,將以「業界最優性價比」為核心競爭力,這項策略有望加速高畫質AI影片生成技術的普及,也讓更多預算有限的創作者能夠負擔專業級工具。 **榜單驗證:技術實力接近國際一線**

在Artificial Analysis的評測中,MiniMax H3以1242分的Elo評分位列文生視頻有聲榜單第二,僅落後Google Gemini Omni Flash的1245分,差距僅3分。該榜單主要評估模型在生成有聲影片時的品質、指令遵循度與多模態一致性,MiniMax能在首次進榜就取得如此成績,顯示其技術實力已接近國際一線水準。 值得注意的是,MiniMax H3是少數能同時處理文字、圖片、影片與聲音,並輸出原生雙聲道音訊的通用模型。這項能力在廣告、品牌與遊戲產業中特別實用,因為這些場景往往需要精準控制畫面與聲音的同步性,例如產品廣告中的旁白、背景音樂與品牌標語的整合。 **開源策略:推動國產晶片生態**

除了技術與價格優勢,MiniMax還宣布將在未來幾天內,於符合法規的前提下開放模型權重,這項舉措將讓開發者與研究機構能自由下載、部署與微調H3模型。同時,MiniMax也積極推動與國產晶片的適配,目標是讓這款模型能在中國本土的硬體平台上高效運作,進一步降低對進口GPU的依賴。 開源不僅能加速社群創新,也有助於建立圍繞MiniMax生態的第三方工具與應用。對於開發者而言,能夠直接取得模型權重,意味著可以針對特定行業需求(如電商、教育、娛樂)進行客製化訓練,或將模型整合進現有工作流程中。這套策略與國際主流AI公司(如Meta的Llama系列)的開源路線相似,有望在中國AI市場中快速累積用戶基礎。 **應用場景:從廣告到遊戲的全方位覆蓋**

MiniMax H3的應用場景相當多元。在廣告與品牌行銷方面,品牌可以輸入產品圖片、品牌標語與參考影片風格,自動生成多支不同版本的廣告短片,用於A/B測試或社群媒體投放。在電商領域,賣家只需提供商品照片與幾句描述,就能產出具備動態展示與語音介紹的商品影片,提升轉換率。 產品設計與UI/UX團隊也能受益:輸入設計稿與互動流程說明,模型可生成動態原型影片,幫助團隊快速驗證設計概念。遊戲開發者則可運用V2V動作遷移功能,將真人動作影片轉換為遊戲角色動作,或快速產出角色動畫與過場片段,大幅縮短開發週期。 **未來展望:多模態AI的平民化時刻**

MiniMax H3的推出,標誌著多模態AI生成技術正從「高階實驗室玩具」走向「人人可用的生產力工具」。2K畫質、三成價格的策略,直接打破了過去高品質AI影片「昂貴、耗時、技術門檻高」的印象。隨著開源計畫的推進與國產晶片的適配,未來可能會有更多本土開發者與企業投入這一生態,進一步加速AI影片生成技術在華語市場的落地。 對創作者來說,這款模型提供了一個極具吸引力的選擇:不必犧牲畫質,也不必負擔驚人費用,就能快速產出專業級音視頻內容。而對於整個產業而言,MiniMax H3的出現,或許正預示著一場由性價比驅動的多模態AI普及浪潮。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

22 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前