MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio
重點摘要
這篇消息聚焦「MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
人工智慧影片生成技術迎來新一波突破,中國 AI 公司 MiniMax 正式發表新一代全模態影片生成模型 MiniMax H3,首度在單一模型中同時整合視覺與聽覺生成的完整流程。不同於市面上多數僅專注於畫面輸出的工具,這款模型的設計目標是讓創作者在產出影片的當下,就獲得包含原生立體聲音效的完整素材,大幅縮短後製與對位工序。 根據官方釋出的技術資訊,MiniMax H3 的核心能力在於能夠直接生成長達 15 秒的 2K 解析度影片片段,並且同步輸出立體聲規格的音頻。這代表模型在生成每一幀畫面的同時,也會根據場景內容、動作節奏與環境脈絡,自動計算並產生對應的環境音、腳步聲、風聲或背景音樂等聲響,最終封裝成一段具備完整視聽體驗的短片。過去這類工作往往需要創作者先產出無聲畫面,再額外透過音訊生成工具或人工配音進行後製,不僅耗時,也容易出現聲畫不同步的問題。 MiniMax 團隊在發表時強調,H3 的「全模態」訴求試圖打破以往影片生成工具僅專注於畫面品質的限制,將聲音、影像等不同模態整合進同一套生成流程。從技術層面來看,這意味著模型內部必須同時理解視覺內容與聽覺內容之間的關聯性,例如人物說話時的口型與發音、物體碰撞時產生的聲響強度、環境中風吹草動的立體聲定位等。只有當模型能夠在統一架構下處理這些跨模態特徵,才能真正實現「所見即所聽」的同步生成。 對於實際應用場景而言,MiniMax H3 的出現無疑為專業影音創作者、短影音內容生產者、遊戲開發者與廣告設計師提供了一條更簡潔的生產路徑。以往從概念構思到完成一支可用的影片素材,通常需要歷經腳本撰寫、分鏡繪製、動畫生成、音效設計、混音對位等多個環節,每個環節都仰賴不同工具與專業人員的協作。現在,透過 H3 的單一模型,創作者只需輸入文字描述或提示詞,就能在短短幾分鐘內獲得一段包含聲音與畫面的成品雛形,大幅降低從概念到成片之間的轉換門檻。 值得注意的是,H3 生成的影片解析度達到了 2K 等級,這在當前 AI 影片生成領域屬於高規格表現。雖然 15 秒的長度對於長片製作來說仍有限制,但對於社群媒體短影片、廣告預告、產品展示、教學演示等場景已相當足夠。結合原生立體聲音頻,這類影片幾乎可以直接用於測試、提案或快速發布,進一步縮短創作週期。 從整個 AI 影片生成發展趨勢來看,MiniMax H3 的推出也反映出該領域正從單一畫面產出,逐步走向同時涵蓋視覺與聽覺內容的整合式發展。過去兩年,各家廠商紛紛推出能夠生成高品質畫面的模型,但聲音部分往往被視為次要環節,甚至被忽略。如今,隨著運算能力與模型架構的進步,將多模態資訊一併處理已成為新的技術競賽焦點。MiniMax 率先在商用產品中實現影片與聲音的同步生成,無疑為市場樹立了新的標竿。 在技術細節方面,雖然官方並未公開完整的模型架構參數,但根據業界分析,H3 很可能採用了類似於擴散模型與變壓器架構的混合設計,並在訓練階段同時納入大量包含音軌的影片素材,讓模型學習視覺與聽覺之間的對應關係。這種訓練方式需要極大的資料量與算力,但也正是如此,模型才能夠在生成時自動判斷場景中應該出現何種聲音,以及該聲音的空間位置與立體聲效果。 對於一般使用者而言,MiniMax H3 的易用性也是重要亮點。創作者無需具備專業的影音編輯技能,只需輸入一段自然語言描述,例如「夕陽下的沙灘,海浪輕拍,遠處有海鷗叫聲,鏡頭緩慢推進」,模型就能根據提示生成一段符合描述的 2K 影片,同時附帶對應的立體聲浪與鳥鳴。這種低門檻的操作方式,有望讓更多非專業人士也能參與影片創作,進一步推動內容生產的民主化。 當然,任何新技術在成熟之前都會面臨挑戰。MiniMax H3 目前生成的影片長度僅 15 秒,對於需要連貫長敘事的影片仍無法勝任;此外,立體聲音頻的品質、口型同步的精準度、以及複雜場景中多音源的分離能力,都有待後續版本持續優化。不過,作為首款將全模態影片生成從概念推向實用階段的產品,H3 已經展示了 AI 在影音創作領域的巨大潛力。 展望未來,隨著算力成本下降與模型效率提升,類似 MiniMax H3 的全模態生成技術很可能成為主流,並逐步擴展到更長的影片時間、更高的解析度,以及更豐富的互動性。MiniMax 此次發表,不僅是自家產品線的重要里程碑,也為整個 AI 影片生成產業指出了下一步的發展方向:從單一模態的畫面產出,邁向真正能夠模擬真實世界視聽體驗的整合式生成。對於創作者、平台業者與終端消費者而言,這都是一個值得關注的技術躍進。
Related
相關文章
真實會計場景評測基準發佈
人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。 APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。
DeepSeek 推出 DeepSeek-V4-Flash-0731 重大更新,強化代理與編碼能力
DeepSeek 於 Hugging Face 發布 DeepSeek-V4-Flash-0731,並於 2026 年 7 月 31 日將官方 V4-Flash API 轉為公開測試版。模型卡明確指出此為正式版本,取代先前的預覽版,且架構與參數量不變。效能提升來自重新訓練,而非全新設計。該檢查點附帶 DSpark 推測解碼模組,與 DeepSeek-V4-Flash-DSpark 結構一致。Hugging Face 顯示該儲存庫有 304B 參數,包含在 284B 基礎模型之上的草稿模組。API 方面,deepseek-v4-flash 現原生支援 Responses API 格式,並針對 Codex 進行調整。V4-Pro API 及應用程式與網頁模型則未更新。是否可部署?可以,有兩種截然不同的方式:透過 API 即可部署。
LingBot-Map 教學:GPU 感知推理與點雲匯出
本教學實作基於 LingBot-Map 的端到端串流 3D 重建流程。首先設定輸入來源、重建參數、檢查點選擇與輸出控制,接著偵測可用 GPU,並根據偵測到的 VRAM 自動調整幀數限制、相機迭代次數、尺度幀與 KV-cache 參數。安裝儲存庫及其相依套件,下載預訓練檢查點,預處理影像或影片幀,並建構具備串流注意力與長程軌跡記憶體的 GCTStream 模型。接著執行混合精度推理,解碼預測的相機姿態與內參數,將深度圖轉換為世界座標點雲,驗證恢復的幾何結構,並視覺化重建場景。
Kimi K3 已提前亮相?神秘模型「Kivine」現身,百萬上下文能力驚豔全球
如果傳聞屬實,Kimi K3 將成為國產模型的重要節點。 作者丨鄭佳美、樊天驕 編輯丨馬曉寧 7 月 15 日,一款名為 Kivine 的匿名模型突然出現在 LMArena。雷峰網按照正常流程,它本應該只是眾多匿名測試模型中的一個,等待用戶通過盲測判斷能力高低。但這一次情況有些不同,在上線之後短短幾個小時內,Kivine 就迅速成為全球 AI 社區關注的焦點。
騰訊科研智能體攻破50年未解數學難題,姚順雨喊話正在招人
騰訊混元科研智能體Hyra參與破解加法組合學領域一道50餘年未解的數學難題,透過提出可無限擴展的參數化構造方案,證明和集擴張指標C(A)可無限接近理論上界2,但無法真正達到。研究團隊已將論文與Lean 4形式化證明公開,首席AI科學家姚順雨也藉此公開招募AI for Science人才。
1/8 參數,跑贏 80B 大模型:Boogu-Image 是黑馬還是雞肋?
這篇消息聚焦「1/8 參數,跑贏 80B 大模型:Boogu-Image 是黑馬還是雞肋?」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。