字節跳動 Seedance 2.5 發佈:30 秒一鏡到底,AI 視頻開始會講故事了
重點摘要
字節跳動正式推出 Seedance 2.5 影片生成模型,單次生成時長從 15 秒翻倍至 30 秒,並能多輪延長且維持人物、場景與風格一致。該模型強化長敘事與多模態參考能力,支援單次輸入最多 30 張圖片、10 段影片與 10 段音頻,可同時還原多人形象與聲音。Seedance 2.5 將陸續上線即夢 AI 與豆包專業版,API 也將接入火山方舟,鎖定影視、廣告、教育等多元場景。
字節跳動正式推出新一代影片生成模型 Seedance 2.5,將單次生成時長從先前的 15 秒一口氣拉高到 30 秒,等於把 AI 影片的創作單位從「短暫片段」推進到「完整場景」的層次。這個新版本不再只是延長畫面,而是讓模型有能力在更長時間內維持邏輯與敘事結構,對影視前製、廣告腳本、教學素材等應用來說,無疑是一次關鍵升級。 Seedance 2.5 將陸續在即夢 AI 與豆包專業版上線,API 服務也預計於近期進駐火山方舟平台,開放給外部開發者與企業串接。字節跳動這次鎖定的應用場景涵蓋影視、廣告、教育、工業製造,甚至包括自動駕駛領域,顯示官方對這個模型定位不僅是創意工具,更是能投入專業生產流程的基礎能力。 技術層面上,Seedance 2.5 延續了統一的多模態音視頻聯合生成架構,但這次突破的重點放在三個方向:長敘事能力、多模態參考能力,以及編輯能力。所謂多模態參考,意味著模型可以同時理解並結合文字指令、圖像特徵甚至聲音線索來生成內容;而編輯能力則讓使用者對既有生成結果進行更細膩的調整與改寫。這些能力疊加後,AI 影片不再只是產出一個影像片段,而是能交付一段具備起承轉合的完整創作。 長敘事是這次發佈最受矚目的亮點。Seedance 2.5 能在 30 秒內組織多個鏡頭,並讓這些鏡頭之間保有邏輯關聯。不同於過去模型只能生成單一視角的短暫動作,Seedance 2.5 有能力安排劇情鋪陳、情節推進、轉折與收尾,讓生成結果看起來更像「被設計過」的影片,而非隨機畫面的堆疊。 官方展示的示範片段具體呈現了這種敘事能力。一段歌手登臺演出的畫面採用一鏡到底方式呈現:鏡頭從紅色幕布縫隙推進,進入暖色燈光的後臺化妝間,年輕女歌手正在整理耳機,工作人員在旁提醒登臺時間。隨後她走出化妝間,穿過長廊與舞伴互動,接過麥克風後步向舞臺。最終鏡頭拉遠至體育館全景,觀眾席上的燈牌、熒光棒與歡呼聲盡收眼底。整個過程在單一連續鏡頭內完成,卻包含了場景轉換、人物互動與情緒節奏的變化,充分展現模型在長鏡頭敘事上的掌握。 除了單次生成時長翻倍,Seedance 2.5 還支援多輪延長機制。使用者可以在既有影片的基礎上繼續生成後續 30 秒,而模型會保持人物主體、場景設定、畫面風格,甚至聲音與音效的一致性。這項能力對需要反覆修改或逐步延伸內容的製作流程特別實用,例如廣告影片可以先確認前段畫面,再逐步延伸出後續情節,不必每次都從零開始生成。 多輪延長的穩定度,長期以來是 AI 影片模型的一大考驗。許多模型在生成單一片段時表現良好,但一旦要求接續內容,人物長相與場景細節就容易產生飄移。Seedance 2.5 刻意強調這方面的表現,顯示字節跳動在維持內容一致性上投入了相當程度的技術資源,也讓 AI 影片從「單次生成」走向「可編輯的連續創作」成為可能。 多模態參考能力的提升,也為創作者提供更大的發揮空間。過去 AI 影片生成大多依賴文字描述一幀幀想像畫面,但 Seedance 2.5 可以結合其他形式輸入作為參考依據,讓生成的內容更貼近使用者的原始構想。這類能力對於影視前期的分鏡規劃、角色設定與風格測試尤其有幫助,創作者不必再用繁複的文字描述來「碰運氣」,而是可以透過圖像或既有影片素材來引導生成方向。 從產業角度來看,Seedance 2.5 的出現,讓 AI 影片生成的應用邊界再度擴大。影視團隊可以用它快速產出概念預覽片,廣告公司可以在短時間內嘗試多種視覺腳本,教育機構能製作更生動的示範素材,工業製造部門則能利用動畫模擬流程或風險情境。連自動駕駛場景也被納入官方提及的應用方向,暗示這套生成技術有機會參與模擬環境建置與感測器資料視覺化等更技術性的工作。 當然,30 秒的生成時長對某些複雜敘事來說仍然有限,但配合多輪延長與編輯能力的導入,創作者已經可以透過分段生成、逐步整合的方式,構築出更長篇的內容。這次更新真正的意義,在於 AI 影片模型終於開始具備「講故事」的基本條件,不再只是畫面的生產器,而是敘事的協作者。隨著 Seedance 2.5 陸續上線,外界也將透過實際使用,進一步檢驗這套模型在真實創作場景中的表現。
Related
相關文章
阿里發佈語音識別新模型,醫療詞彙"聽中率"破 95%,曾拿全球最低錯字率
阿里巴巴發布語音識別大模型 Qwen-Audio-3.0-ASR-Flash,主打精準辨識專業詞彙,醫療場景「聽中率」突破 95.36%,並曾以 1.7% 錯字率拿下全球第一。模型提供三個版本,涵蓋實時語音、離線轉寫等場景,已透過阿里雲百鍊平台開放使用。
Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統
AI資訊AI新閒資訊正文Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘Anthropic發佈最新安全報告披露,在內部安全測試過程中,旗下Claude系列模型曾因測試環境配置問題意外訪問互聯網,並未經授權進入三家不同機構的生產系統。事件涉及Claude Opus4.
Google Earth推出基於Nano Banana 2的全新圖像生成功能 一鍵生成逼真AI場景與歷史風貌
Google Earth推出基於Nano Banana 2的全新圖像生成功能,全球網頁端用戶可在地圖上輸入指令,將真實地點重塑為逼真AI場景。此功能可應用於歷史教學、房地產規劃及趣味體驗,例如復原龐貝古城街景或模擬未來建築,現已正式上線。
阿里千問發佈Qwen-Audio-3.0-ASR-Flash,語音識別攻克專業場景"最後一公里"
阿里通義千問發布語音識別大模型Qwen-Audio-3.0-ASR-Flash,主打長音頻上下文記憶與內建多行業詞庫,醫療、IT等專業術語無需配置即可精準識別。該模型支援30餘種語言,並整合語音潤色功能,已在阿里雲百鍊平台開放調用。同步推出的Streaming版本鎖定即時場景,延遲僅300毫秒,系列先前於評測拿下全球第一。
PolyAI Releases Dialog-RSN-1: An Audio-Native Dialog Model That Fuses Turn-Taking, Speech Recognition, Function Calling, And Response
PolyAI has introduced Dialog-RSN-1, a dialog model that perceives the caller’s audio directly instead of reading a transcript.
200個任務、1700萬幀!大曉ACE-Data-0把真實家庭場景變成物理智能「數據引擎」
近日,基於全球首創的具身模型信息密度定律與以人為中心的環境式數據採集方案2.0,並依託環境式採集引擎ACE,大曉機器人聯合南洋理工大學 S-Lab 重磅開源 L5 級多模態具身物理智能數據集 ACE-Data-0。