又一國產模型重磅開源,有聲視頻編輯全球第一,16家芯片及平臺首日適配

2026年8月4日 08:04
又一國產模型重磅開源,有聲視頻編輯全球第一,16家芯片及平臺首日適配

重點摘要

MiniMax 正式開源新一代通用視頻模型 MiniMax H3,該模型在有聲視頻編輯榜單上以 1130 分 Elo 成績位居全球第一。H3 可生成最長 15 秒、最高 2K 解析度並帶有原生立體聲音頻的視頻,並獲得華為昇騰、AMD 等 16 家芯片及平台的首日適配支持。

站內 AI 整理稿

MiniMax 今(4)日正式開源新一代通用視頻模型 MiniMax H3,這款號稱「有聲影片編輯全球第一」的模型,不僅能生成最長 15 秒、最高 2K 解析度且附帶原生立體聲音效的影片,更在首日獲得 16 家國內外晶片廠商與開發平台的適配支援。根據 Artificial Analysis 有聲影片編輯榜單,MiniMax H3 以 1130 分的 Elo 成績位居榜首,領先 Gemini Omni Flash、HappyHorse-1.0、Wan 2.7 等知名國內外影片模型。

MiniMax H3 被定位為一套通用型全模態生成系統,能夠統一理解文本、圖像、影片與音訊組成的多模態上下文,並同步輸出畫面與聲音。在輸出規格上,H3 支援 4 秒至 15 秒的影片長度,可選擇 21:9、16:9、4:3、1:1、3:4、9:16 等多種畫面比例,幀率為 24FPS,同時生成 32kHz 的立體聲音頻。模型預設輸出短邊 768 像素的影片,開發者還能透過 H3-Regenerate-2K 模組進一步提升至 2K 解析度。語言方面,H3 穩定支援中文、英文、日文、韓文、法文、德文等 11 種語言,對其他語言也提供不同程度的支援。

為了讓開發者更方便上手,MiniMax 同步開放了 H3 模型的下載連結,並提供 H3-2K 直出、H3-Context-IR、H3-Regenerate-2K 等 API 體驗入口,以及海螺 AI 與 MiniMax Hub 等應用平台。開源首日,華為昇騰、摩爾線程、沐曦、海光資訊、崑崙芯、天數智芯、壁仞科技、AMD、Intel 等晶片廠商,加上 Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub、fal 等開發社群與雲推理平台,以及 vLLM-Omni、SGLang 等推理框架,共 16 家生態夥伴已完成相關適配。

根據實際測試,MiniMax H3 已能勝任多種影片生成任務。例如,在生成一段 15 秒的風光攝影航拍影片時,畫面中的雪山、草地等自然景觀相當真實,色彩、光影與航拍鏡頭運動也流暢自然,長鏡頭整體保持良好視覺連貫性;不過,畫面中的寺廟建築仍帶有較明顯的 AI 生成痕跡。另外,在測試一段奶茶與遊戲 IP 聯動的廣告影片時,模型生成的 6 個分鏡頭敘事順序清晰,風格與氛圍統一,但出現了一處明顯重複:店員向顧客遞出奶茶的動作連續呈現了兩次。H3 系統由三個模組組成:H3-Context-IR、H3-Base 與 H3-Regenerate-2K。

H3-Context-IR 是一套託管式預處理與編排系統,負責解析文本、圖像、音訊與參考影片之間的關係,以及這些素材與預期生成結果之間的關聯。其內部工作流包含指令解析、跨模態關聯、時序理解與複雜邏輯推理。由於該模組依賴多階段工作流與多個託管模型,MiniMax 目前僅提供 API 與提示詞指南,暫未開源原始碼。H3-Base 是實際生成音視頻的核心模組。文本經由 H3-Encoder 編碼,視覺素材同時經過 H3-Encoder 與 H3-VisualVAE 處理,音訊則由 H3-AudioVAE 編碼。不同模態的資訊被組織成統一序列,輸入 H3-Omni-Transformer 進行生成。

H3-Base 提供兩種版本:H3-Base-FL2VA 與 H3-Base-Ref2VA。FL2VA 版本為首尾幀模式,最多可輸入兩張圖像,支援文生影片、首幀生影片、尾幀生影片,以及根據指定首尾畫面生成中間影片內容。Ref2VA 版本則支援全模態參考模式,最多可輸入 9 張圖像,影片最多 3 段(每段 2 至 15 秒,總時長不超過 15 秒),音訊最多 3 段(每段 2 至 15 秒,總時長不超過 15 秒,且必須與圖像或影片一同輸入)。

H3-Regenerate-2K 是負責提升解析度的模組,與傳統的超級解析度方案不同,它讓基礎模型結合原始文本及多模態參考素材,對已生成的 768p 影片重新生成,以還原小文字與精細紋理等細節。該模組同樣尚未開源,開發者需透過官方 API 才能完整實現 2K 生成流程。對於開發者來說,H3-Base 支援本地部署,透過 SGLang、vLLM、diffusers 與 ComfyUI 等框架或工作流即可運行,並支援多 GPU 平行推理。僅部署 H3-Base 時,可生成短邊 768 像素的音視頻。

若要獲得完整 2K 工作流,則需結合本地模型與官方 API:先由 H3-Context-IR 理解並擴展使用者輸入,再由本地 H3-Base 生成 768p 音視頻,最後透過 H3-Regenerate-2K 重新生成 2K 影片。MiniMax 也提供了文生音視頻、首幀生音視頻與全模態參考生成等可復現案例,相關請求參數、範例程式碼與參考結果皆可在 Hugging Face 模型頁面查閱。從實際表現來看,MiniMax H3 在自然風光、商業廣告等不同類型任務中已展現出一定水準,畫面自然度、鏡頭組織與風格一致性都有不錯的完成度。

隨著多家晶片廠商、開發社群與推理框架同步完成適配,這次開源不僅釋出了模型能力,也初步打通了從模型下載、本地部署到應用開發的生態鏈路。全模態影片模型之間的競爭,正從單一畫面效果進一步延伸至聲音生成、複雜指令理解與產業生態建設。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

38 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前