MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio
重點摘要
中國AI公司MiniMax發表新一代全模態影片生成模型MiniMax H3,能在單一模型中直接生成長達15秒的2K解析度影片,並同步輸出原生立體聲規格的音頻。此模型整合視覺與聽覺生成流程,讓創作者只需輸入文字描述即可快速獲得包含聲音與畫面的完整素材,大幅縮短後製與對位工序。
人工智慧影片生成技術迎來新一波突破,中國 AI 公司 MiniMax 正式發表新一代全模態影片生成模型 MiniMax H3,首度在單一模型中同時整合視覺與聽覺生成的完整流程。不同於市面上多數僅專注於畫面輸出的工具,這款模型的設計目標是讓創作者在產出影片的當下,就獲得包含原生立體聲音效的完整素材,大幅縮短後製與對位工序。根據官方釋出的技術資訊,MiniMax H3 的核心能力在於能夠直接生成長達 15 秒的 2K 解析度影片片段,並且同步輸出立體聲規格的音頻。
這代表模型在生成每一幀畫面的同時,也會根據場景內容、動作節奏與環境脈絡,自動計算並產生對應的環境音、腳步聲、風聲或背景音樂等聲響,最終封裝成一段具備完整視聽體驗的短片。過去這類工作往往需要創作者先產出無聲畫面,再額外透過音訊生成工具或人工配音進行後製,不僅耗時,也容易出現聲畫不同步的問題。MiniMax 團隊在發表時強調,H3 的「全模態」訴求試圖打破以往影片生成工具僅專注於畫面品質的限制,將聲音、影像等不同模態整合進同一套生成流程。從技術層面來看,這意味著模型內部必須同時理解視覺內容與聽覺內容之間的關聯性,例如人物說話時的口型與發音、物體碰撞時產生的聲響強度、環境中風吹草動的立體聲定位等。
只有當模型能夠在統一架構下處理這些跨模態特徵,才能真正實現「所見即所聽」的同步生成。對於實際應用場景而言,MiniMax H3 的出現無疑為專業影音創作者、短影音內容生產者、遊戲開發者與廣告設計師提供了一條更簡潔的生產路徑。以往從概念構思到完成一支可用的影片素材,通常需要歷經腳本撰寫、分鏡繪製、動畫生成、音效設計、混音對位等多個環節,每個環節都仰賴不同工具與專業人員的協作。現在,透過 H3 的單一模型,創作者只需輸入文字描述或提示詞,就能在短短幾分鐘內獲得一段包含聲音與畫面的成品雛形,大幅降低從概念到成片之間的轉換門檻。
值得注意的是,H3 生成的影片解析度達到了 2K 等級,這在當前 AI 影片生成領域屬於高規格表現。雖然 15 秒的長度對於長片製作來說仍有限制,但對於社群媒體短影片、廣告預告、產品展示、教學演示等場景已相當足夠。結合原生立體聲音頻,這類影片幾乎可以直接用於測試、提案或快速發布,進一步縮短創作週期。從整個 AI 影片生成發展趨勢來看,MiniMax H3 的推出也反映出該領域正從單一畫面產出,逐步走向同時涵蓋視覺與聽覺內容的整合式發展。過去兩年,各家廠商紛紛推出能夠生成高品質畫面的模型,但聲音部分往往被視為次要環節,甚至被忽略。
如今,隨著運算能力與模型架構的進步,將多模態資訊一併處理已成為新的技術競賽焦點。MiniMax 率先在商用產品中實現影片與聲音的同步生成,無疑為市場樹立了新的標竿。在技術細節方面,雖然官方並未公開完整的模型架構參數,但根據業界分析,H3 很可能採用了類似於擴散模型與變壓器架構的混合設計,並在訓練階段同時納入大量包含音軌的影片素材,讓模型學習視覺與聽覺之間的對應關係。這種訓練方式需要極大的資料量與算力,但也正是如此,模型才能夠在生成時自動判斷場景中應該出現何種聲音,以及該聲音的空間位置與立體聲效果。對於一般使用者而言,MiniMax H3 的易用性也是重要亮點。
創作者無需具備專業的影音編輯技能,只需輸入一段自然語言描述,例如「夕陽下的沙灘,海浪輕拍,遠處有海鷗叫聲,鏡頭緩慢推進」,模型就能根據提示生成一段符合描述的 2K 影片,同時附帶對應的立體聲浪與鳥鳴。這種低門檻的操作方式,有望讓更多非專業人士也能參與影片創作,進一步推動內容生產的民主化。當然,任何新技術在成熟之前都會面臨挑戰。MiniMax H3 目前生成的影片長度僅 15 秒,對於需要連貫長敘事的影片仍無法勝任;此外,立體聲音頻的品質、口型同步的精準度、以及複雜場景中多音源的分離能力,都有待後續版本持續優化。
不過,作為首款將全模態影片生成從概念推向實用階段的產品,H3 已經展示了 AI 在影音創作領域的巨大潛力。展望未來,隨著算力成本下降與模型效率提升,類似 MiniMax H3 的全模態生成技術很可能成為主流,並逐步擴展到更長的影片時間、更高的解析度,以及更豐富的互動性。MiniMax 此次發表,不僅是自家產品線的重要里程碑,也為整個 AI 影片生成產業指出了下一步的發展方向:從單一模態的畫面產出,邁向真正能夠模擬真實世界視聽體驗的整合式生成。對於創作者、平台業者與終端消費者而言,這都是一個值得關注的技術躍進。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣
過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。