MiniMax H3 追到身後,留給 Seedance 的安全身位不多了

2026年8月18日 09:11
MiniMax H3 追到身後,留給 Seedance 的安全身位不多了
站內 AI 整理稿

新立場Pro2026.08.18 09:09 · 來自四川全文5580字00:00 / 16:22昨日的驚豔,終會成為今日的尋常。文 | 新立場7月底的一次 Seed 全員會上,張一鳴罕見地談起模型蒸餾。他向團隊明確表達了一個態度:不要依靠競爭對手模型的輸出來縮短追趕時間,即使因此需要承擔一些短期損失。他沒有要求團隊更快追上下一張榜單,相反,字節願意把時間留給更長期的模型能力。這次表態把字節對模型競爭的一項取捨說得很清楚——短期排名可以讓,基礎能力不能靠複製對手來補。Seedance恰好提供了一個已經跑出結果的多模態樣本。今年2月發佈的 Seedance 2.

0,已經把文字、圖片、視頻和聲音放進同一套音視頻生成模型。6月公佈的 Seedance 2.5 繼續把單次視頻拉長到30秒,並強化複雜參考和編輯能力。2.0證明了這條路線可以領先,2.5開始回答這種領先能維持多久。一個多月後,MiniMax也沿著相似方向往前走。7月31日,MiniMax發佈視頻模型H3。文字、圖片、視頻和聲音可以同時進入模型,用戶可以讓它參考一段視頻的運鏡、另一張圖片的人物和第三段音頻的聲音,再通過自然語言完成生成或編輯,MiniMax同時宣佈將在數日內開放模型權重,希望開發者自行部署和定製。兩家公司正在把視頻模型做成越來越相似的東西,它們都不再滿足於“一句話生成一段視頻”。

但模型越像,兩家公司用來維持領先的方法反而越不一樣。MiniMax選擇把H3推向開放權重路線,希望開發者、芯片公司和第三方工具替它擴大部署範圍;字節仍然把Seedance放在自己的產品體系裡,用即夢、豆包以及越來越多內部業務承接模型。一家向外借速度。另一家,則開始在最底層主動買時間。用預訓練堆出的第一2025年底,Seedance模型團隊有過一次聚餐,席間,Seedance負責人曾妍向上級提出,她仍然希望嘗試一個更大的模型,參數至少做到200B。當時團隊內部並非沒有反對意見。

有人認為,直接把模型放大到200B甚至300B風險太高,在訓練資源並不寬裕的情況下,先做一個100B級模型是更穩妥的方案。一位高管恰好參加了這次聚餐。他了解曾妍的想法後,表示可以幫助協調資源。之後的正式評審會上,Seed負責人吳永輝和視覺多模態生成負責人周暢最終支持了更大模型的方案。Seedance 此前也走過彎路,PixelDance早期從圖像擴散路線延伸,快手可靈則更早押注原生視頻DiT,一度保持領先。到2024年底,字節逐漸把視頻生成資源收攏到Seed,並重新調整技術路線。轉折發生在 Seedance 2.0,曾妍和團隊堅持繼續擴大預訓練規模,把數據和模型結構做得更重。

多位接近團隊人士稱,Seedance 2.0的數據評測團隊達到上千人;核心算法團隊本身只有十幾人,但每名算法工程師背後,都有更大的數據團隊承擔標準制定、尋源、清洗和評測,Seedance甚至幾乎沒有直接依賴抖音視頻作為主要訓練數據,而是採購了大量高質量影視素材。多位視頻行業從業者後來把Seedance 2.0的提升概括成一句話:這是一場數據的勝利。今年2月,結果出來。Seedance 2.0不再只是文生視頻模型。它可以同時讀取文字、圖片、聲音和已有視頻,把主體參考、運鏡、音頻和編輯放在同一次任務裡。

字節4月公開的技術報告顯示,模型支持4—15秒原生音視頻生成,以及最多9張圖片、3段視頻和3段音頻參考。這種模型定義也正迅速成為行業共識,在H3的官方技術介紹裡,MiniMax專門回顧了此前視頻模型的割裂狀態:文生視頻、圖生視頻、動作遷移、聲音參考和視頻編輯往往被拆成不同任務。H3想做的是把這些能力重新放進同一個上下文,通過自然語言描述素材之間以及素材與最終視頻之間的關係。MiniMax甚至主動放棄了一部分上一代架構設計,因為它認為“任務泛化”比延續某一種架構優勢更重要。H3最終支持文字、圖片、視頻和音頻聯合輸入,也把視頻生成和編輯放進同一模型。

兩邊最後走到了相近的位置,對Seedance來說,這並不意味著此前的技術投入失去意義。截至目前,Seedance 2.0仍處在主流第三方視頻評測的第一梯隊。過去,一個模型做好原生聲音、多鏡頭和主體一致性,就足以和競爭者拉開明顯差距;現在,這些能力開始同時出現在不同公司的旗艦模型裡。H3的出現讓這件事變得更具體,原生聲音、多模態參考、動作控制和視頻編輯,正在從少數模型的差異化能力,變成旗艦視頻模型共同爭奪的基礎能力。模型能力仍然是Seedance獲得用戶的第一張門票,但一次模型領先已經越來越難獨自解釋長期領先。

MiniMax向外借速度,字節向內買時間H3發佈時,MiniMax在官方博客裡用了相當大的篇幅解釋為什麼要開放權重。第一是開發者社區,第二是國產芯片適配,第三是讓用戶能夠按照自己的需求定製模型。MiniMax還稱,H3從設計早期就考慮了多款國產芯片的兼容。7月31日,路透社也確認了這項開放權重計劃。這是一個技術選擇,也是一個分發選擇,MiniMax有海螺、MiniMax Hub和API,也已經服務大量個人和企業用戶。但在視頻內容產業裡,它沒有抖音和TikTok,也沒有字節那樣可以直接承接模型的大規模創作、分發和廣告體系。

MiniMax官網目前披露,其模型和AI產品“累計服務”超過3億個人用戶、100萬餘企業客戶及開發者。如果開放權重按計劃落地,開發者和硬件廠商就會成為H3新的分發節點。一個芯片廠商完成適配,一家推理平臺增加H3,一套視頻工作流把它納入默認模型,MiniMax都多了一條不完全依賴自身銷售團隊的觸達路徑。開放路線也不意味著MiniMax放棄官方服務。H3仍通過API提供完整能力;MiniMax稱,其2K版本的單位時長價格不到主流模型的三分之一。它一邊擴大模型可部署範圍,一邊保留官方推理和商業服務。字節面對的是另一種情況,今年春節,Seedance 2.

0在豆包、剪映和即夢等產品大規模接入後,一度因為需求過大出現長時間排隊。到7月底,Seedance 2.5又被放進了Gauth,Business Insider報道,這款字節旗下教育應用擁有8600萬月活用戶,8月4日起開始用Seedance 2.5把歷史課程轉換成帶旁白的AI視頻。而一個有意思的變化同時發生在Seed內部,這家以快速試錯、數據反饋和高頻迭代聞名的公司,正在基礎模型研究上主動放慢考核。2025年1月,字節成立Seed Edge。官方給這支研究計劃的定義是,專門支持更長週期、高不確定性的研究課題,為入選方向提供獨立算力,並採用更長週期的考核方式。

張一鳴也重新回到了AI研發討論裡,據澎湃新聞此前援引知情人士報道,從2024年下半年起,張一鳴開始定期參加Seed核心技術團隊的覆盤和討論。到了今年夏天,他又把一個長期存在於Seed內部的問題擺到臺前上。8月6日,路透社援引澎湃新聞報道稱,張一鳴要求團隊不要依靠蒸餾競爭對手模型來提高能力,即使因此要犧牲部分短期收益。這裡需要區分一個容易混淆的概念,字節限制的不是蒸餾本身。Seedance 1.0就使用過多階段蒸餾提高推理速度,Seed今年的招聘方向也仍包括模型蒸餾。張一鳴反對的是把競爭對手前沿模型當成“教師”,用對方已經產生的能力換取短期排名。從這個意義上說,字節並沒有真的選擇慢。

字節願意把更長的週期留給基礎研究,模型一旦做出來,產品側仍然按照另一套速度運行。MiniMax在向外借速度——讓更多開發者替H3找到使用場景;字節則在向內買時間——允許模型研究花更久,再依靠自己已有的產品把時間追回來。這可能比“開源還是閉源”更接近兩家公司真正的分歧。第二場競爭,在模型之外Seedance 2.0先證明了一件事,即在當前的視頻模型市場,足夠明顯的能力領先可以很快換成收入。截止6月,Seedance 已經貢獻了火山 MaaS收入的一半以上。相比大語言模型已經進入價格競爭的視頻模型市場,Seedance 2.

0發佈後的幾個月裡,火山開始拿到廣告、短劇、漫劇和其他內容生產客戶的大額模型訂單。但當模型真正進入生產環境以後,問題也發生了變化。客戶開始考慮的,從哪一個模型最好,開始向哪一個模型值得把未來幾個月甚至一年的產能押上去轉變。周志鵬就是其中一個例子。3月的一天下午,水母智能聯合創始人周志鵬正在北京百望山爬山,一連接到6個火山引擎銷售電話,內容都是推銷Seedance 2.0。按照後來的報道,他第二天決定簽約。讓他真正猶豫的並不是1000萬元本身,而是這筆錢意味著未來一年相當一部分視頻產能會綁定在Seedance上。

客戶購買的因此不只有Token,也包含對Seedance未來能繼續領先多長時間的判斷。這已經反映在收入結構裡。6月接受媒體採訪時,火山引擎負責人譚待稱,Seedance貢獻了今年火山MaaS收入的一半以上。6月再次接受採訪時,譚待本人確認,Seedance貢獻火山當時MaaS收入的一半以上。模型領先第一次變成了一筆足夠大的生意,問題也隨之改變:這種領先還能持續多久?H3出現後,這些一年期合同裡的風險也更清楚了:客戶買下一年的額度,模型之間的差距卻可能在幾個月內重新變化。MiniMax在7月31日的H3官方博客中已經把“參與內容生產全過程”寫進模型方向。

它想解決的也不只是生成一條畫面,也包括通過自然語言繼續承擔修改和複雜任務。模型越來越能幹之後,新的問題又會出現。Seedance 2.0一次只能處理十餘份參考輸入時,用戶首先關心的是模型能不能看懂素材;當下一代模型可以承載更多人物、場景、聲音和時間線,用戶的問題會慢慢變成:這些素材誰來整理,角色如何綁定,第17秒的一處錯誤怎樣單獨返工,幾段30秒視頻怎樣繼續保持同一個人物和敘事節奏。模型能夠承擔的任務越複雜,模型之外的工作也越多。Seedance 2.5把單次生成提高到30秒、參考素材增加到50份後,素材管理、角色綁定、局部返工和片段銜接都會變成新的工程問題。

LibTV等工作流產品開始承接這些環節。底層模型越接近,客戶留下來的理由也就越需要向模型之外延伸。不過,字節還有兩項MiniMax短期內不容易複製的東西。一項是Seedance背後的數據、預訓練和Infra體系,已經構成Seedance比較重的模型生產體系。而Seed今年的招聘方向仍覆蓋基礎模型、多模態、Long-Horizon Task和訓練基礎設施,說明字節還在繼續補這一層。另一層在模型上面,字節自己擁有模型落地的場景。即夢提供創作者場景,火山引擎連接廣告、電商和內容製作客戶,Gauth又把Seedance帶入教育,同一款模型因此能夠更快進入不同類型的真實任務。

字節的產品優勢主要體現在場景和分發,而不能簡單等同於“拿抖音數據訓練模型”。而此前的調查恰好給出了相反的細節:Seedance 2.0的核心訓練大量採購高質量影視素材,幾乎沒有直接使用抖音數據。即夢、火山引擎和Gauth分別把Seedance帶進創作、企業服務和教育,模型做出來以後,字節很少缺第一個使用場景。創作者在哪裡頻繁返工,企業客戶願意為什麼能力付費,哪些能力值得優先迭代,都可以更早在產品側得到驗證。MiniMax給出的方向,是讓更多外部開發者和硬件廠商圍繞H3部署、適配和開發。開放權重落地後,企業可以自行部署,芯片廠商可以圍繞它適配,工作流團隊也可以繼續把H3嵌進自己的產品。

一邊把閉環做在公司內部,另一邊把閉環交給生態,誰更有效,目前還沒有答案,對於Seedance來說,真正危險的是當客戶願意一次簽下一年的額度,它實際押注的是Seedance的領先能夠維持多久。H3出現以後,這個賭注會變得更難下。一次榜單第一可以帶來訂單,持續領先需要的是另外一套能力。寫在最後張一鳴這次在Seed全員會上談的“長期主義”,最終是一筆資源選擇。不使用競爭對手模型的輸出補齊能力,意味著Seed需要自己準備更多數據、做更多實驗,也要承擔方向失敗和短期落後的成本。Seed Edge採用更長考核週期,同樣意味著公司要允許一部分算力和研究人員長時間沒有直接業務結果。Seedance 2.

0讓字節看到了一次回報,2025年底,曾妍在聚餐上爭取的那批額外訓練資源,最後成為了一款進入全球第一梯隊的視頻模型;幾個月後,火山引擎銷售開始拿著它敲企業客戶的門。一代模型的領先可以來自一次正確押注,持續領先則需要一套能夠反覆生產下一代優勢的機制。H3已經開始覆蓋一批與Seedance相似的生成、參考和編輯能力。下一次還會有Kling、Wan以及新的模型。對字節而言,長期主義真正要證明的不是它能不能忍受幾個月的落後,而是多花掉的時間、數據和算力,最終能不能換來競爭者更難複製的下一步。MiniMax走了另一條路。

它選擇把H3推向開放生態,希望更多開發者和硬件廠商參與模型的部署、適配和應用開發,一家把速度放到外面,一家把時間留在裡面。不過字節沒有真的變慢,模型一旦做好,即夢、豆包、火山引擎和Gauth仍然會要求它迅速進入用戶。它只是開始嘗試把一家公司拆成兩個速度:底層研究允許慢,模型之上的產品仍然快。H3 追到身後之後,Seedance 下一次真正需要證明的,是它多花的時間,能不能換來競爭對手更難追上的下一步。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛