阿里視頻大模型Wan3.0開啟公測:文檔、ppt也能變視頻

阿里視頻大模型 Wan3.0 開啟公測:上傳 PPT 和文檔,即可生成完整視頻故事 8 月 6 日,阿里巴巴視頻生成大模型 Wan 3.0 正式開啟公測。此次升級覆蓋生成時長、全能創作、全能參考與真實世界還原等多個核心維度,標誌著 AI 視頻生成從「生成單個鏡頭」向「講述完整故事」邁出關鍵一步。尤其值得關注的是,Wan 3.0 首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,用戶只需上傳一份產品說明書或教學課件,搭配簡單提示詞,即可生成一條完整的形象片或教學視頻。這一變化,讓視頻生成模型從內容創作工具,進一步晉升為可直接服務於辦公、教育與商業場景的生產力基礎設施。
### 單次生成 30 秒視頻,敘事節奏更從容 Wan 3.0 最直觀的升級,在於單段視頻生成時長被拓展至 30 秒。在以往的 AI 視頻工具中,用戶往往只能生成數秒鐘的短片段,鏡頭語言的表達受到極大限制,連續運鏡、一鏡到底等複雜拍攝手法難以實現。而 30 秒的生成能力,讓 AI 能夠承載更完整的敘事結構,從場景鋪墊、情節推進到情緒爆發,都能夠在單次生成中流暢呈現。同時,Wan 3.0 還具備智能時長功能,可根據用戶輸入的提示詞內容,自動推薦最適合的視頻時長,降低了手動調參的門檻,讓創作者能更專注於內容本身。
### 文檔直接變視頻,教學課件與業務彙報一鍵生成 如果說時長升級是量變,那麼文檔輸入支持則堪稱質變。Wan 3.0 正從一個單純的視頻生成模型,躍遷為信息的綜合表達載體。除了傳統的文本、圖片、音頻、視頻四種基礎模態之外,此次公測首次加入了對結構化文檔的理解能力,支援 doc、xls、ppt、pdf、md 等常見辦公格式,單個文件或連結不超過 100MB、50 頁。舉例來說,用戶上傳一個智能眼鏡產品的 PPT,輸入「生成一支產品形象片」的提示詞,Wan 3.0 便能自動提取 PPT 中的產品賣點、設計語言和數據圖表,將其轉化為具有敘事節奏的視頻畫面。
這意味著,教學課件、產品演示、業務彙報等日常辦公內容,都能在分鐘級別內被改寫成高質量的視頻形式,極大提升了信息傳播的效率與表現力。### 提示詞工程賦能,文檔信息精準調度 能夠實現文檔到視頻的跨越,背後依託的是 Wan 3.0 強大的提示詞工程與指令遵循能力。模型能夠將用戶輸入的自然語言提示詞,轉化為調度各類輸入信息的中樞,精準控制哪些文字內容該被呈現、哪些圖表該被強調、哪些視覺風格該被採用。在處理結構化文檔時,Wan 3.0 不僅能讀懂文字,還能理解版面佈局與邏輯層級,將原本靜態的知識體系,重構為動態的視聽語言。
這一能力的突破,讓 AI 視頻生成不再依賴於用戶提供精修的分鏡腳本,而是可以從粗糙的原始素材中,自主提煉出具有傳播價值的核心敘事。### 真實世界還原升級:千人千面與細粒度穩定保持 伴隨視頻生成模型從內容生成走向生產力工具,用戶對畫面的要求已不止於清晰,更在於真實。Wan 3.0 在此次升級中,力求精準復刻現實世界的複雜細節。在人物表現上,生成視頻中的人像做到「千人千面」,五官刻畫與皮膚質感更加敏銳,人物情緒表達自然剋制,微表情與肢體動作能夠彼此聯動,不再像過往 AI 視頻中常見的僵硬與塑膠感。
在場景與道具層面,全能參考任務中的角色、道具、聲音、空間關係、風格等細粒度維度,均能在生成過程中保持穩定一致,避免了以往多鏡頭切換時出現的角色外貌漂移或場景邏輯混亂問題。### 數字化信息也有審美,圖表數據不再枯燥 除了對物理世界的還原,Wan 3.0 還針對數字化信息畫面進行了美學升級。在以往的 AI 視頻中,圖表、數據與界面內容的呈現往往相對粗糙,難以融入整體視頻的視覺風格。此次 Wan 3.0 對螢幕錄製、數據可視化、UI 介面等內容的畫面質感進行了專門優化,讓原本枯燥的數據圖表也能擁有電影級的質感與光感。
這對於金融分析、科技測評、企業彙報等大量依賴數據展示的視頻場景而言,無疑是重大利好,使得 AI 生成的視頻在商業與專業場合中更具說服力。### 視頻編輯能力大幅提升:改畫面、改劇情、改臺詞 Wan 3.0 的視頻編輯能力同樣迎來大幅升級。新版本支援對已生成視頻進行局部修改,用戶可以針對畫面中的特定元素進行調整,也可以修改劇情走向,甚至改變角色臺詞。這意味著創作者不再需要為了修正一個小瑕疵而重新生成整段視頻,大幅提升了後期製作的靈活性與效率。不過,官方也坦言,Wan 3.0 在聲音質感與文字準確度方面,仍存在進步空間。
在包含大量精確文字或高保真音效的場景中,模型表現仍有待進一步優化,這也是團隊後續迭代的重點方向。### 多平台同步公測,API 價格同步公佈 即日起,Wan 3.0 已在阿里雲百鍊、萬鏡一刻、萬相官網、千問創作 PC 端、IF STUDIO 和堆友等平台開啟公測,並在千問 APP 中灰度開放。對於開發者與企業用戶最為關心的 API 服務,Wan 3.0 也公佈了明確的定價策略:480P 解析度為 0.3 元/秒,720P 為 0.6 元/秒,1080P 為 1.2 元/秒。API 接口將於近期全量開放,屆時企業可將 Wan 3.0 的視頻生成與編輯能力,便捷地整合進自身的產品與工作流程之中。
### AI 視頻賽道升溫,從「玩具」走向「工具」 縱觀當下 AI 視頻生成賽道,各大廠商都在加速迭代。就在 Wan 3.0 發佈的同一周,螞蟻集團開源了 Avernet,探索人與智能體的高效協作模式;PPIO 也正式發佈「Fusion 融合模型」,試圖以十分之一的價格實現頂級模型的智商。與此同時,阿里巴巴旗下的 Qwen3.8 Agentic 能力在 Artificial Analysis 榜單中得分全球第一,顯示出阿里在 AI 底層能力上的持續積累。在此背景下,Wan 3.
0 的此次升級,不僅是單一產品的功能躍遷,更折射出行業的整體趨勢:AI 視頻生成正在告別「炫技」階段,向著真正解決用戶實際問題的生產力工具演進。當文檔、PPT 都能輕鬆變成電影級視頻,內容生產的門檻將被進一步拉低,而創意與表達的邊界,也將被重新定義。
Related
相關文章

Anthropic深夜放大招:Claude Opus 5.5上線,任務成本大降40%
智東西(公眾號:zhidxcom) 編譯 | 楊京麗 編輯 | 李水青 智東西9月23日消息,今天凌晨,Anthropic發佈Claude Opus 5.5,這是Claude 5.5系列的首款模型。Anthropic稱,新模型在多數任務上的表現與Claude Fable 5.1相當,默認設置下的典型任務成本較上一代Opus 5降低40%,輸出速度提升超過30%。 在官方公佈的9項測試中,Opus 5.5有7項成績領先Fable 5.1、Opus 5、GPT-6 Astra和GPT-5.6 Sol。其中,Opus 5.5在三項編程測試中均取得最高分,但在業務流程和科研Agent測試中仍落後於GPT-6 Astra。 在第三方評測機構Artificial Analysis的Intelligence榜單上,Claude Opus 5.5以58分位列第一,領先Claude Fable 5.1和GPT-6 Astra的53分。 具體任務中,Anthropic披露,Opus 5.5用9.5小時完成了將負載均衡軟件HAProxy從C語言改寫為Rust的任務,成本比Fable 5.1低51%;在要求逐一核對數字和引語的財報研究測試中,其生成的18份報告有16份達標,Fable 5.1和Opus 5則均未通過。此外,一名早期測試者使用Opus 5.5,不到一天完成了涉及68萬行代碼的遷移。 價格方面,Opus 5.5每百萬輸入、輸出Token分別收費4美元(約合人民幣26.8元)和20美元(約合人民幣134元),較Opus 5下調20%;緩存讀取價格較Opus 5下降60%。與此同時,Anthropic提高了多個付費套餐的五小時使用額度,並向訂閱用戶提供一次可自行選擇使用時間的額度重置機會。 Opus 5.5已上線Claude及亞馬遜雲科技、谷歌雲、微軟Azure等平臺。不過,部分專業任務仍

OpenAI 宣佈將在 AI 模型開發早期階段引入第三方獨立安全評估
AI資訊AI新聞資訊正文OpenAI 宣佈將在 AI 模型開發早期階段引入第三方獨立安全評估發佈於AI新聞資訊發佈時間 :2026年9月23號 9:11閱讀 :1分鐘面對外界持續增長的對人工智能潛在風險的擔憂,OpenAI 近期公佈了最新的安全治理動向。據相關報道,該公司計劃打破傳統的內部閉環測試模式,將第三方獨立機構正式引入 AI 模型開發週期的更早階段,對其進行系統性的安全風險評估。為了確保這一創新機制能夠真正發揮實質性作用,OpenAI 同時明確了此類外部評估得以有效開展的核心優先事項。具體包括四大關鍵支柱:必須具備強有力的獨立運作機制、嚴格遵循科學的嚴謹性、落實穩健的日常安全實踐,以及在各方之間劃分清晰明確的安全責任。這一舉措表明,隨著前沿人工智能模型的迭代速度不斷加快,行業頭部企業正在進一步主動向外部開放,通過引入客觀公正的第三方力量來共同構築安全防線,從而回應公眾與監管機構對技術可控性的長遠審視。相關推薦被指“OpenClaw換皮”後,Meta罕見承認:產品設計確實深受其影響Meta超級智能實驗室產品負責人Nat Friedman回應稱,AI代理Muse設計確受OpenClaw影響,但系從零創建。此前AI應用聯合創始人Ansh Nanda發帖稱Muse是面向普通用戶的OpenClaw,並曬對話顯示AI自認系統文件相似非巧合而是匹配。社區還發現Muse存在更多相似之處。2026年9月23號 9:1297.3kAI 基建遭反噬:Q2 美國 680 億美元數據中心項目因公眾反對受阻AI驅動數據中心建設在美國遇公眾強烈反對。研究顯示,今年二季度約680億美元項目延期或受阻,一季度達1300億,反對已覆蓋半數項目。Data Center Watch稱二季度共45個數據中心開發項目遭阻撓或延。2026年9月23號 8:5673.0kOpenAI 推出 GPT-6 Sol 和

被指“OpenClaw換皮”後,Meta罕見承認:產品設計確實深受其影響
AI資訊AI新聞資訊正文被指“OpenClaw換皮”後,Meta罕見承認:產品設計確實深受其影響發佈於AI新聞資訊發佈時間 :2026年9月23號 9:12閱讀 :1分鐘Meta超級智能實驗室(MSL)產品負責人Nat Friedman日前在X上回應稱,旗下AI代理產品Muse“在產品設計上確實深受OpenClaw的影響”,但Muse本身“從零開始創建”。此番回應源於AI應用聯合創始人Ansh Nanda的一篇瘋傳帖子,後者稱“Muse簡直就是面向普通用戶的OpenClaw”,並曬出與Muse的對話,其中AI代理自認其系統文件與OpenClaw的相似性並非“巧合”而是“匹配”。社區隨後發現:Muse同樣包含一個SOUL.md文件——以Markdown編寫的純文本配置文件,用於定義AI代理的個性、溝通風格、價值觀、行為邊界與專業領域,且其內容與OpenClaw的文件幾乎完全相同。面對追問,Friedman未予否認,僅回覆“我們認為Peter(Steinberger,OpenClaw創建者)把這些都做得完全正確”。Friedman為前GitHub CEO,去年與Meta首席AI官Alexandr Wang一同加入Meta。他透露,今年一月試用OpenClaw後,曾為MSL團隊購買數百臺Mac mini,許多人由此愛上OpenClaw等個人代理軟件;開發Muse的目標是打造類似OpenClaw的產品,使其安全可靠、易於使用,並能擴展至數十億用戶。OpenClaw為開源項目,Meta借鑑其設計並不意外;OpenAI今年早些時候已挖走其創始人。這也延續Meta一貫策略:吸納有潛力的產品並複製其最佳功能,最著名的案例是對Snapchat Stories功能的借鑑。Muse目前反響熱烈,近期登頂美國App Store排行榜;若直接比較平臺與市場覆蓋範圍,其發展速度已超過ChatGPT。M

OpenAI 推出 GPT-6 Sol 和 Luna:API 價格大降 50%,單任務成本最低不到競品一成
AI資訊AI新聞資訊正文OpenAI 推出 GPT-6 Sol 和 Luna:API 價格大降 50%,單任務成本最低不到競品一成發佈於AI新聞資訊發佈時間 :2026年9月23號 8:54閱讀 :2分鐘OpenAI 當日發佈 GPT-6 系列的最新成員——GPT-6 Sol 和 GPT-6 Luna。兩款模型採用與 GPT-6 Astra 類似的訓練方法,把 Astra 在專業工作、事實性、編碼、計算機使用和對齊等方面的最先進性能,帶入更快、更經濟的模型。OpenAI 也強調,GPT-6 Astra 仍是其整體最優秀的模型,追求無妥協體驗仍應首選它。價格砍半,成本最低不到競品一成GPT-6 Sol 和 Luna 的 API 價格相比 GPT-5.6 促銷價降低 50%。更值得注意的是單任務成本:在 AutomationBench 跨應用業務流程測試中,GPT-6 Sol 在 xhigh 強度下表現優於 Claude Opus 5,成本卻僅為 Opus 5 每任務成本的 9%;同一測試 high 強度下,GPT-6 Luna 較前代提升 5.4%,每項任務成本降低 58%。評估智能體的 Last Exam 測試中,GPT-6 Sol 在 max effort 狀態下得分 56.4%,高於 Claude Opus 5 在該評估中的最高分,每任務成本還降低 60%。事實可靠性同樣進步:GPT-6 Sol 的錯誤率約為前代的一半,接近 Astra 級可靠性且成本更低;Luna 的事實可靠性也大幅提升。性能逼近旗艦,長任務更省編程方面,兩款模型均針對 AI Coding Agent 工作負載優化。FrontierCode 1.1 Main 測試中,GPT-6 Sol 較 GPT-5.6 Sol 明顯提升,並以更低成本達到 Claude Fable 5.1 xhigh 相當水平。De

Anthropic上線Claude Opus 5.5 ,任務成本大降 40%
AI資訊AI新聞資訊正文Anthropic上線Claude Opus 5.5 ,任務成本大降 40%發佈於AI新聞資訊發佈時間 :2026年9月23號 8:53閱讀 :3分鐘Anthropic 發佈 Claude Opus 5.5,這是 Claude 5.5 系列的首款模型。Anthropic 稱,新模型在多數任務上的表現與 Claude Fable 5.1 相當,但默認設置下的典型任務成本較上一代 Opus 5 降低 40%,輸出速度提升超過 30%。發佈約兩小時後,OpenAI 也推出了 GPT-6 Sol 和 GPT-6 Luna,GPT-6“宇宙”再添新成員。成本降四成、速度提三成,編程測試領跑在官方公佈的 9 項測試中,Opus 5.5 有 7 項成績領先 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol。其中三項編程測試(Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0)均拿下最高分,分別為 66.4%、54.4% 和 57.8%;但在業務流程和科研 Agent 測試上仍落後於 GPT-6 Astra。第三方機構 Artificial Analysis 的 Intelligence 榜單上,Opus 5.5 以 58 分位列第一,領先 Fable 5.1 與 GPT-6 Astra 的 53 分。價格方面,Opus 5.5 每百萬輸入、輸出 Token 分別收費 4 美元(約 26.8 元)和 20 美元(約 134 元),較 Opus 5 下調 20%,緩存讀取價格下降 60%。Claude Code 與 Claude Platform 還提供快速模式,速度最高達普通模式 2.5 倍,相應收費為輸入 8 美元、輸出 40 美元每百萬 Token。Anthropic 同時
OpenAI 推出 GPT-6 Sol 和 Luna:API 價格大降 50%,單任務成本最低不到競品一成
AI資訊AI新閒資訊正文OpenAI 推出 GPT-6 Sol 和 Luna:API 價格大降 50%,單任務成本最低不到競品一成發布於AI新閒資訊時間 :Sep 23, 2026閱讀 :2分鐘OpenAI 當日發佈 GPT-6 系列的最新成員——GPT-6 Sol 和 GPT-6 Luna。兩款模型採用與 GPT-6 Astra 類似的訓練方法,把 Astra 在專業工作、事實性、編碼、計算機使用和對齊等方面的最先進性能,帶入更快、更經濟的模型。OpenAI 也強調,GPT-6 Astra 仍是其整體最優秀的模型,追求無妥協體驗仍應首選它。價格砍半,成本最低不到競品一成GPT-6 Sol 和 Luna 的 API 價格相比 GPT-5.6 促銷價降低 50%。更值得注意的是單任務成本:在 AutomationBench 跨應用業務流程測試中,GPT-6 Sol 在 xhigh 強度下表現優於 Claude Opus 5,成本卻僅為 Opus 5 每任務成本的 9%;同一測試 high 強度下,GPT-6 Luna 較前代提升 5.4%,每項任務成本降低 58%。評估智能體的 Last Exam 測試中,GPT-6 Sol 在 max effort 狀態下得分 56.4%,高於 Claude Opus 5 在該評估中的最高分,每任務成本還降低 60%。事實可靠性同樣進步:GPT-6 Sol 的錯誤率約為前代的一半,接近 Astra 級可靠性且成本更低;Luna 的事實可靠性也大幅提升。性能逼近旗艦,長任務更省編程方面,兩款模型均針對 AI Coding Agent 工作負載優化。FrontierCode 1.1 Main 測試中,GPT-6 Sol 較 GPT-5.6 Sol 明顯提升,並以更低成本達到 Claude Fable 5.1 xhigh 相當水平。DeepSWE