量子位生成式AI

阿里視頻大模型Wan3.0開啟公測:文檔、ppt也能變視頻

2026年8月7日 11:32
阿里視頻大模型Wan3.0開啟公測:文檔、ppt也能變視頻

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里視頻大模型Wan3.

站內 AI 整理稿

## 阿里視頻大模型 Wan3.0 開啟公測:上傳 PPT 和文檔,即可生成完整視頻故事

8 月 6 日,阿里巴巴視頻生成大模型 Wan 3.0 正式開啟公測。此次升級覆蓋生成時長、全能創作、全能參考與真實世界還原等多個核心維度,標誌著 AI 視頻生成從「生成單個鏡頭」向「講述完整故事」邁出關鍵一步。尤其值得關注的是,Wan 3.0 首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,用戶只需上傳一份產品說明書或教學課件,搭配簡單提示詞,即可生成一條完整的形象片或教學視頻。這一變化,讓視頻生成模型從內容創作工具,進一步晉升為可直接服務於辦公、教育與商業場景的生產力基礎設施。 ### 單次生成 30 秒視頻,敘事節奏更從容

Wan 3.0 最直觀的升級,在於單段視頻生成時長被拓展至 30 秒。在以往的 AI 視頻工具中,用戶往往只能生成數秒鐘的短片段,鏡頭語言的表達受到極大限制,連續運鏡、一鏡到底等複雜拍攝手法難以實現。而 30 秒的生成能力,讓 AI 能夠承載更完整的敘事結構,從場景鋪墊、情節推進到情緒爆發,都能夠在單次生成中流暢呈現。同時,Wan 3.0 還具備智能時長功能,可根據用戶輸入的提示詞內容,自動推薦最適合的視頻時長,降低了手動調參的門檻,讓創作者能更專注於內容本身。 ### 文檔直接變視頻,教學課件與業務彙報一鍵生成

如果說時長升級是量變,那麼文檔輸入支持則堪稱質變。Wan 3.0 正從一個單純的視頻生成模型,躍遷為信息的綜合表達載體。除了傳統的文本、圖片、音頻、視頻四種基礎模態之外,此次公測首次加入了對結構化文檔的理解能力,支援 doc、xls、ppt、pdf、md 等常見辦公格式,單個文件或連結不超過 100MB、50 頁。舉例來說,用戶上傳一個智能眼鏡產品的 PPT,輸入「生成一支產品形象片」的提示詞,Wan 3.0 便能自動提取 PPT 中的產品賣點、設計語言和數據圖表,將其轉化為具有敘事節奏的視頻畫面。這意味著,教學課件、產品演示、業務彙報等日常辦公內容,都能在分鐘級別內被改寫成高質量的視頻形式,極大提升了信息傳播的效率與表現力。 ### 提示詞工程賦能,文檔信息精準調度

能夠實現文檔到視頻的跨越,背後依託的是 Wan 3.0 強大的提示詞工程與指令遵循能力。模型能夠將用戶輸入的自然語言提示詞,轉化為調度各類輸入信息的中樞,精準控制哪些文字內容該被呈現、哪些圖表該被強調、哪些視覺風格該被採用。在處理結構化文檔時,Wan 3.0 不僅能讀懂文字,還能理解版面佈局與邏輯層級,將原本靜態的知識體系,重構為動態的視聽語言。這一能力的突破,讓 AI 視頻生成不再依賴於用戶提供精修的分鏡腳本,而是可以從粗糙的原始素材中,自主提煉出具有傳播價值的核心敘事。 ### 真實世界還原升級:千人千面與細粒度穩定保持

伴隨視頻生成模型從內容生成走向生產力工具,用戶對畫面的要求已不止於清晰,更在於真實。Wan 3.0 在此次升級中,力求精準復刻現實世界的複雜細節。在人物表現上,生成視頻中的人像做到「千人千面」,五官刻畫與皮膚質感更加敏銳,人物情緒表達自然剋制,微表情與肢體動作能夠彼此聯動,不再像過往 AI 視頻中常見的僵硬與塑膠感。在場景與道具層面,全能參考任務中的角色、道具、聲音、空間關係、風格等細粒度維度,均能在生成過程中保持穩定一致,避免了以往多鏡頭切換時出現的角色外貌漂移或場景邏輯混亂問題。 ### 數字化信息也有審美,圖表數據不再枯燥

除了對物理世界的還原,Wan 3.0 還針對數字化信息畫面進行了美學升級。在以往的 AI 視頻中,圖表、數據與界面內容的呈現往往相對粗糙,難以融入整體視頻的視覺風格。此次 Wan 3.0 對螢幕錄製、數據可視化、UI 介面等內容的畫面質感進行了專門優化,讓原本枯燥的數據圖表也能擁有電影級的質感與光感。這對於金融分析、科技測評、企業彙報等大量依賴數據展示的視頻場景而言,無疑是重大利好,使得 AI 生成的視頻在商業與專業場合中更具說服力。 ### 視頻編輯能力大幅提升:改畫面、改劇情、改臺詞

Wan 3.0 的視頻編輯能力同樣迎來大幅升級。新版本支援對已生成視頻進行局部修改,用戶可以針對畫面中的特定元素進行調整,也可以修改劇情走向,甚至改變角色臺詞。這意味著創作者不再需要為了修正一個小瑕疵而重新生成整段視頻,大幅提升了後期製作的靈活性與效率。不過,官方也坦言,Wan 3.0 在聲音質感與文字準確度方面,仍存在進步空間。在包含大量精確文字或高保真音效的場景中,模型表現仍有待進一步優化,這也是團隊後續迭代的重點方向。 ### 多平台同步公測,API 價格同步公佈

即日起,Wan 3.0 已在阿里雲百鍊、萬鏡一刻、萬相官網、千問創作 PC 端、IF STUDIO 和堆友等平台開啟公測,並在千問 APP 中灰度開放。對於開發者與企業用戶最為關心的 API 服務,Wan 3.0 也公佈了明確的定價策略:480P 解析度為 0.3 元/秒,720P 為 0.6 元/秒,1080P 為 1.2 元/秒。API 接口將於近期全量開放,屆時企業可將 Wan 3.0 的視頻生成與編輯能力,便捷地整合進自身的產品與工作流程之中。 ### AI 視頻賽道升溫,從「玩具」走向「工具」

縱觀當下 AI 視頻生成賽道,各大廠商都在加速迭代。就在 Wan 3.0 發佈的同一周,螞蟻集團開源了 Avernet,探索人與智能體的高效協作模式;PPIO 也正式發佈「Fusion 融合模型」,試圖以十分之一的價格實現頂級模型的智商。與此同時,阿里巴巴旗下的 Qwen3.8 Agentic 能力在 Artificial Analysis 榜單中得分全球第一,顯示出阿里在 AI 底層能力上的持續積累。在此背景下,Wan 3.0 的此次升級,不僅是單一產品的功能躍遷,更折射出行業的整體趨勢:AI 視頻生成正在告別「炫技」階段,向著真正解決用戶實際問題的生產力工具演進。當文檔、PPT 都能輕鬆變成電影級視頻,內容生產的門檻將被進一步拉低,而創意與表達的邊界,也將被重新定義。

Related

相關文章

梁文鋒,告別“價格屠夫”

DeepSeek宣布近期將大幅調漲API服務定價,結束過去兩年的「地板價」策略,引發開發者社群熱議。此舉主因是全球算力資源緊張與推理成本高漲,也反映大模型行業正從「貼錢換規模」的價格戰,轉向更理性的定價框架。

剛剛

AI電詐入侵華爾街,2000億規模對沖基金遇襲

AI電詐入侵華爾街,2000億規模對沖基金遇襲 華爾街頂級對沖基金,如今也成為AI語音詐騙的獵物。Point72、Citadel、Millennium這三家被譽為對沖基金「御三家」的巨頭,合計管理著數千億美元資產,近期相繼透露遭到AI語音克隆技術的入侵。犯罪手法相當精巧,駭客監聽目標人物的電話通話,從中擷取聲音特徵、語調與用字習慣,再以AI即時合成聲音,偽裝成內部高層或IT人員,誘使員工提供驗證碼、帳戶資訊或系統存取權限。

剛剛

AI博主站上風口

AI博主站上風口:熱度與焦慮並存的內容新賽道 AI浪潮正以肉眼可見的速度改寫科技產業的格局。過去一個月,各大AI大模型廠商動作密集到令人應接不暇:月之暗面在7月17日發布2.8萬億參數規模的Kimi K3,並於7月27日正式開源完整模型權重;Anthropic緊隨其後於7月24日推出Claude Opus 5;谷歌在7月30日發布了面向具身智能的Gemini Robotics ER 2;7月31日,MiniMax發布全模態模型H3,字節發布視頻創作模型Seedance 2.

剛剛
量子位生成式AI

AI SSD:大模型推理的存儲範式轉移

**AI SSD:大模型推理的存儲範式轉移** 過去兩年,AI基礎設施的競爭焦點始終圍繞GPU數量、芯片算力、HBM帶寬與高速網絡展開。然而,隨著大模型進入長上下文、複雜推理與多智能體階段,決定一套系統能產出多少有效Token的因素,已遠不止於計算峰值。GPU依然是算力底座,但其實際利用率越來越取決於模型權重、KV Cache與MoE專家能否在正確的時間抵達正確的計算節點。

剛剛

Science重磅:AI首次生成完整噬菌體基因組,可存活、能抑菌

生成式基因組設計時代或已到來:斯坦福大學團隊近日在《科學》(Science)雜誌上發表突破性成果,首次由人工智能(AI)直接生成完整噬菌體基因組。這些由AI設計的噬菌體不僅能存活,還能感染並抑制細菌,部分生成株甚至表現出比天然噬菌體更強的適應能力,能夠快速突破細菌的耐藥性。研究團隊表示,這項技術有望為對抗快速進化的細菌病原體提供全新路徑,但同時也需警惕其潛在的生物安全風險。 長期以來,完整基因組的設計一直被視為合成生物學的難題。

剛剛