量子位生成式AI

阿里視頻大模型Wan3.0開啟公測:文檔、ppt也能變視頻

2026年8月7日 11:32
阿里視頻大模型Wan3.0開啟公測:文檔、ppt也能變視頻

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里視頻大模型Wan3.

站內 AI 整理稿

## 阿里視頻大模型 Wan3.0 開啟公測:上傳 PPT 和文檔,即可生成完整視頻故事

8 月 6 日,阿里巴巴視頻生成大模型 Wan 3.0 正式開啟公測。此次升級覆蓋生成時長、全能創作、全能參考與真實世界還原等多個核心維度,標誌著 AI 視頻生成從「生成單個鏡頭」向「講述完整故事」邁出關鍵一步。尤其值得關注的是,Wan 3.0 首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,用戶只需上傳一份產品說明書或教學課件,搭配簡單提示詞,即可生成一條完整的形象片或教學視頻。這一變化,讓視頻生成模型從內容創作工具,進一步晉升為可直接服務於辦公、教育與商業場景的生產力基礎設施。 ### 單次生成 30 秒視頻,敘事節奏更從容

Wan 3.0 最直觀的升級,在於單段視頻生成時長被拓展至 30 秒。在以往的 AI 視頻工具中,用戶往往只能生成數秒鐘的短片段,鏡頭語言的表達受到極大限制,連續運鏡、一鏡到底等複雜拍攝手法難以實現。而 30 秒的生成能力,讓 AI 能夠承載更完整的敘事結構,從場景鋪墊、情節推進到情緒爆發,都能夠在單次生成中流暢呈現。同時,Wan 3.0 還具備智能時長功能,可根據用戶輸入的提示詞內容,自動推薦最適合的視頻時長,降低了手動調參的門檻,讓創作者能更專注於內容本身。 ### 文檔直接變視頻,教學課件與業務彙報一鍵生成

如果說時長升級是量變,那麼文檔輸入支持則堪稱質變。Wan 3.0 正從一個單純的視頻生成模型,躍遷為信息的綜合表達載體。除了傳統的文本、圖片、音頻、視頻四種基礎模態之外,此次公測首次加入了對結構化文檔的理解能力,支援 doc、xls、ppt、pdf、md 等常見辦公格式,單個文件或連結不超過 100MB、50 頁。舉例來說,用戶上傳一個智能眼鏡產品的 PPT,輸入「生成一支產品形象片」的提示詞,Wan 3.0 便能自動提取 PPT 中的產品賣點、設計語言和數據圖表,將其轉化為具有敘事節奏的視頻畫面。這意味著,教學課件、產品演示、業務彙報等日常辦公內容,都能在分鐘級別內被改寫成高質量的視頻形式,極大提升了信息傳播的效率與表現力。 ### 提示詞工程賦能,文檔信息精準調度

能夠實現文檔到視頻的跨越,背後依託的是 Wan 3.0 強大的提示詞工程與指令遵循能力。模型能夠將用戶輸入的自然語言提示詞,轉化為調度各類輸入信息的中樞,精準控制哪些文字內容該被呈現、哪些圖表該被強調、哪些視覺風格該被採用。在處理結構化文檔時,Wan 3.0 不僅能讀懂文字,還能理解版面佈局與邏輯層級,將原本靜態的知識體系,重構為動態的視聽語言。這一能力的突破,讓 AI 視頻生成不再依賴於用戶提供精修的分鏡腳本,而是可以從粗糙的原始素材中,自主提煉出具有傳播價值的核心敘事。 ### 真實世界還原升級:千人千面與細粒度穩定保持

伴隨視頻生成模型從內容生成走向生產力工具,用戶對畫面的要求已不止於清晰,更在於真實。Wan 3.0 在此次升級中,力求精準復刻現實世界的複雜細節。在人物表現上,生成視頻中的人像做到「千人千面」,五官刻畫與皮膚質感更加敏銳,人物情緒表達自然剋制,微表情與肢體動作能夠彼此聯動,不再像過往 AI 視頻中常見的僵硬與塑膠感。在場景與道具層面,全能參考任務中的角色、道具、聲音、空間關係、風格等細粒度維度,均能在生成過程中保持穩定一致,避免了以往多鏡頭切換時出現的角色外貌漂移或場景邏輯混亂問題。 ### 數字化信息也有審美,圖表數據不再枯燥

除了對物理世界的還原,Wan 3.0 還針對數字化信息畫面進行了美學升級。在以往的 AI 視頻中,圖表、數據與界面內容的呈現往往相對粗糙,難以融入整體視頻的視覺風格。此次 Wan 3.0 對螢幕錄製、數據可視化、UI 介面等內容的畫面質感進行了專門優化,讓原本枯燥的數據圖表也能擁有電影級的質感與光感。這對於金融分析、科技測評、企業彙報等大量依賴數據展示的視頻場景而言,無疑是重大利好,使得 AI 生成的視頻在商業與專業場合中更具說服力。 ### 視頻編輯能力大幅提升:改畫面、改劇情、改臺詞

Wan 3.0 的視頻編輯能力同樣迎來大幅升級。新版本支援對已生成視頻進行局部修改,用戶可以針對畫面中的特定元素進行調整,也可以修改劇情走向,甚至改變角色臺詞。這意味著創作者不再需要為了修正一個小瑕疵而重新生成整段視頻,大幅提升了後期製作的靈活性與效率。不過,官方也坦言,Wan 3.0 在聲音質感與文字準確度方面,仍存在進步空間。在包含大量精確文字或高保真音效的場景中,模型表現仍有待進一步優化,這也是團隊後續迭代的重點方向。 ### 多平台同步公測,API 價格同步公佈

即日起,Wan 3.0 已在阿里雲百鍊、萬鏡一刻、萬相官網、千問創作 PC 端、IF STUDIO 和堆友等平台開啟公測,並在千問 APP 中灰度開放。對於開發者與企業用戶最為關心的 API 服務,Wan 3.0 也公佈了明確的定價策略:480P 解析度為 0.3 元/秒,720P 為 0.6 元/秒,1080P 為 1.2 元/秒。API 接口將於近期全量開放,屆時企業可將 Wan 3.0 的視頻生成與編輯能力,便捷地整合進自身的產品與工作流程之中。 ### AI 視頻賽道升溫,從「玩具」走向「工具」

縱觀當下 AI 視頻生成賽道,各大廠商都在加速迭代。就在 Wan 3.0 發佈的同一周,螞蟻集團開源了 Avernet,探索人與智能體的高效協作模式;PPIO 也正式發佈「Fusion 融合模型」,試圖以十分之一的價格實現頂級模型的智商。與此同時,阿里巴巴旗下的 Qwen3.8 Agentic 能力在 Artificial Analysis 榜單中得分全球第一,顯示出阿里在 AI 底層能力上的持續積累。在此背景下,Wan 3.0 的此次升級,不僅是單一產品的功能躍遷,更折射出行業的整體趨勢:AI 視頻生成正在告別「炫技」階段,向著真正解決用戶實際問題的生產力工具演進。當文檔、PPT 都能輕鬆變成電影級視頻,內容生產的門檻將被進一步拉低,而創意與表達的邊界,也將被重新定義。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

45 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前