阿里視頻大模型Wan3.0開啟公測:文檔、ppt也能變視頻

阿里視頻大模型 Wan3.0 開啟公測:上傳 PPT 和文檔,即可生成完整視頻故事 8 月 6 日,阿里巴巴視頻生成大模型 Wan 3.0 正式開啟公測。此次升級覆蓋生成時長、全能創作、全能參考與真實世界還原等多個核心維度,標誌著 AI 視頻生成從「生成單個鏡頭」向「講述完整故事」邁出關鍵一步。尤其值得關注的是,Wan 3.0 首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,用戶只需上傳一份產品說明書或教學課件,搭配簡單提示詞,即可生成一條完整的形象片或教學視頻。這一變化,讓視頻生成模型從內容創作工具,進一步晉升為可直接服務於辦公、教育與商業場景的生產力基礎設施。
### 單次生成 30 秒視頻,敘事節奏更從容 Wan 3.0 最直觀的升級,在於單段視頻生成時長被拓展至 30 秒。在以往的 AI 視頻工具中,用戶往往只能生成數秒鐘的短片段,鏡頭語言的表達受到極大限制,連續運鏡、一鏡到底等複雜拍攝手法難以實現。而 30 秒的生成能力,讓 AI 能夠承載更完整的敘事結構,從場景鋪墊、情節推進到情緒爆發,都能夠在單次生成中流暢呈現。同時,Wan 3.0 還具備智能時長功能,可根據用戶輸入的提示詞內容,自動推薦最適合的視頻時長,降低了手動調參的門檻,讓創作者能更專注於內容本身。
### 文檔直接變視頻,教學課件與業務彙報一鍵生成 如果說時長升級是量變,那麼文檔輸入支持則堪稱質變。Wan 3.0 正從一個單純的視頻生成模型,躍遷為信息的綜合表達載體。除了傳統的文本、圖片、音頻、視頻四種基礎模態之外,此次公測首次加入了對結構化文檔的理解能力,支援 doc、xls、ppt、pdf、md 等常見辦公格式,單個文件或連結不超過 100MB、50 頁。舉例來說,用戶上傳一個智能眼鏡產品的 PPT,輸入「生成一支產品形象片」的提示詞,Wan 3.0 便能自動提取 PPT 中的產品賣點、設計語言和數據圖表,將其轉化為具有敘事節奏的視頻畫面。
這意味著,教學課件、產品演示、業務彙報等日常辦公內容,都能在分鐘級別內被改寫成高質量的視頻形式,極大提升了信息傳播的效率與表現力。### 提示詞工程賦能,文檔信息精準調度 能夠實現文檔到視頻的跨越,背後依託的是 Wan 3.0 強大的提示詞工程與指令遵循能力。模型能夠將用戶輸入的自然語言提示詞,轉化為調度各類輸入信息的中樞,精準控制哪些文字內容該被呈現、哪些圖表該被強調、哪些視覺風格該被採用。在處理結構化文檔時,Wan 3.0 不僅能讀懂文字,還能理解版面佈局與邏輯層級,將原本靜態的知識體系,重構為動態的視聽語言。
這一能力的突破,讓 AI 視頻生成不再依賴於用戶提供精修的分鏡腳本,而是可以從粗糙的原始素材中,自主提煉出具有傳播價值的核心敘事。### 真實世界還原升級:千人千面與細粒度穩定保持 伴隨視頻生成模型從內容生成走向生產力工具,用戶對畫面的要求已不止於清晰,更在於真實。Wan 3.0 在此次升級中,力求精準復刻現實世界的複雜細節。在人物表現上,生成視頻中的人像做到「千人千面」,五官刻畫與皮膚質感更加敏銳,人物情緒表達自然剋制,微表情與肢體動作能夠彼此聯動,不再像過往 AI 視頻中常見的僵硬與塑膠感。
在場景與道具層面,全能參考任務中的角色、道具、聲音、空間關係、風格等細粒度維度,均能在生成過程中保持穩定一致,避免了以往多鏡頭切換時出現的角色外貌漂移或場景邏輯混亂問題。### 數字化信息也有審美,圖表數據不再枯燥 除了對物理世界的還原,Wan 3.0 還針對數字化信息畫面進行了美學升級。在以往的 AI 視頻中,圖表、數據與界面內容的呈現往往相對粗糙,難以融入整體視頻的視覺風格。此次 Wan 3.0 對螢幕錄製、數據可視化、UI 介面等內容的畫面質感進行了專門優化,讓原本枯燥的數據圖表也能擁有電影級的質感與光感。
這對於金融分析、科技測評、企業彙報等大量依賴數據展示的視頻場景而言,無疑是重大利好,使得 AI 生成的視頻在商業與專業場合中更具說服力。### 視頻編輯能力大幅提升:改畫面、改劇情、改臺詞 Wan 3.0 的視頻編輯能力同樣迎來大幅升級。新版本支援對已生成視頻進行局部修改,用戶可以針對畫面中的特定元素進行調整,也可以修改劇情走向,甚至改變角色臺詞。這意味著創作者不再需要為了修正一個小瑕疵而重新生成整段視頻,大幅提升了後期製作的靈活性與效率。不過,官方也坦言,Wan 3.0 在聲音質感與文字準確度方面,仍存在進步空間。
在包含大量精確文字或高保真音效的場景中,模型表現仍有待進一步優化,這也是團隊後續迭代的重點方向。### 多平台同步公測,API 價格同步公佈 即日起,Wan 3.0 已在阿里雲百鍊、萬鏡一刻、萬相官網、千問創作 PC 端、IF STUDIO 和堆友等平台開啟公測,並在千問 APP 中灰度開放。對於開發者與企業用戶最為關心的 API 服務,Wan 3.0 也公佈了明確的定價策略:480P 解析度為 0.3 元/秒,720P 為 0.6 元/秒,1080P 為 1.2 元/秒。API 接口將於近期全量開放,屆時企業可將 Wan 3.0 的視頻生成與編輯能力,便捷地整合進自身的產品與工作流程之中。
### AI 視頻賽道升溫,從「玩具」走向「工具」 縱觀當下 AI 視頻生成賽道,各大廠商都在加速迭代。就在 Wan 3.0 發佈的同一周,螞蟻集團開源了 Avernet,探索人與智能體的高效協作模式;PPIO 也正式發佈「Fusion 融合模型」,試圖以十分之一的價格實現頂級模型的智商。與此同時,阿里巴巴旗下的 Qwen3.8 Agentic 能力在 Artificial Analysis 榜單中得分全球第一,顯示出阿里在 AI 底層能力上的持續積累。在此背景下,Wan 3.
0 的此次升級,不僅是單一產品的功能躍遷,更折射出行業的整體趨勢:AI 視頻生成正在告別「炫技」階段,向著真正解決用戶實際問題的生產力工具演進。當文檔、PPT 都能輕鬆變成電影級視頻,內容生產的門檻將被進一步拉低,而創意與表達的邊界,也將被重新定義。
Related
相關文章

後摩智能確認其下代大模型端邊 AI 芯片採用 3D CIM 存算一體架構
作者:溯波(實習) 責編:溯波 評論: 9 月 22 日消息,後摩智能 (HOUMO.AI) 在近日舉行的 2026 全球 AI 芯片峰會上確認,該公司下代大模型端邊 AI 芯片將採用 3D CIM 存算一體架構,結合融合存算與 3D DRAM 技術。
剛剛,高通2nm雙旗艦來了,為智能體AI重造架構,手機能跑300億參數大模型
作者 | ZeR0 編輯 | 漠影 剛剛,高通最強手機芯片來了!夏威夷毛伊島9月22日現場報道,在驍龍峰會2026上,高通一口氣推出兩款採用2nm製程的旗艦芯片——第六代驍龍8超級至尊版和第六代驍龍8至尊版。這是高通首次在旗艦產品線同時推出兩款驍龍8至尊版平臺,也是驍龍平臺首次採用2nm製程。

拿下 2 億日活躍用戶後,消息稱字節跳動豆包收縮對話團隊
作者:清源 責編:清源 評論: 9 月 22 日消息,《晚點 LatePost》今天(22 日)晚間發佈消息稱,豆包通用 Session 團隊正在減員,規模預計減半。該團隊此前約有 50 人,一度是豆包內規模最大的團隊,主要負責豆包的對話(Chat)產品能力,包括策略、評測等工作。

聯合國秘書長古特雷斯呼籲全球監管人工智能,避免出現殺人機器人
作者:遠洋 責編:遠洋 評論: 9 月 22 日消息,據彭博社報道,聯合國秘書長進一步呼籲對人工智能實施監管,以避免出現企業權力氾濫、殺人機器人橫行的反烏托邦未來。安東尼奧 · 古特雷斯(Antonio Guterres)在聯合國大會上向各國領導人發表卸任前最後一次講話,就人工智能的各類風險發出警示。

8萬億,梁文鋒也開始卷“超大”
字母榜2026.09.22 20:43 · 來自北京全文3463字00:00 / 10:03參數越大越氣派。文 | 字母榜DeepSeek也加入參數大競賽了。據The Information報道,DeepSeek目前正在訓練一個約2萬億參數的新模型;梁文鋒還在近期一場投資者會議上表示,公司下一步計劃繼續把模型推到8萬億參數。放在一年前,8萬億還是個難以想象的數字。但現在,Kimi K3已經做到2.8萬億參數;字節正在預訓練一個最高可能達到10萬億參數的新模型;阿里也公開表示,下一代模型將向5萬億到10萬億參數推進。

OPPO 推出“AI 心力球”可穿戴新品,體驗價 499 元
作者:潞源 責編:潞源 評論: 感謝網友 Autumn_Dream、野原小哀、files 的線索投遞!9 月 22 日消息,OPPO 今天召開新品發佈會,除了推出 Find X10 系列手機新品以外,OPPO 本次還帶來了全新品類穿戴產品“AI 心力球”。