阿里視頻大模型Wan3.0開啟公測:文檔、ppt也能變視頻
重點摘要
阿里巴巴發布視頻生成大模型Wan 3.0並開啟公測,單次可生成30秒視頻,並首次支援doc、xls、ppt、pdf等文檔格式輸入,能將文檔直接轉換為影片。該模型力求真實還原人物與場景,提升視頻編輯能力,但聲音質感與文字準確度仍有進步空間。
阿里巴巴旗下視頻生成大模型 Wan 3.0 於 8 月 6 日正式開啟公開測試,這次版本在生成時長、創作靈活性、參考能力以及真實世界還原等面向進行全面升級。最引人注目的變化之一是單次生成可達 30 秒的連續影片,讓 AI 視頻從過去只能產出單一鏡頭,進化到能夠完整講述一段故事。這項延展對於需要連續運鏡、一鏡到底等複雜鏡頭語言的使用者來說,敘事節奏將更加遊刃有餘。Wan 3.0 還內建智能時長功能,可根據使用者輸入的提示詞自動推薦最適合的影片長度,降低創作門檻。除了時長突破,Wan 3.0 最大的亮點在於首度支援文檔格式輸入,包括 doc、xls、ppt、pdf、md 等常見結構化檔案。
這意味著模型不再只是單純的影像生成工具,而是進化為資訊表達的載體。使用者可以上傳一份產品簡報、教學課件或業務報告,搭配提示詞,就能自動生成對應的影片內容。例如上傳一個智能眼鏡產品的 PPT,加上簡單描述,系統便能產出一支完整的形象片。單個文件或連結的大小限制為不超過 100MB、50 頁,足以應付多數商業與教學場景。這項能力的背後,是模型在提示詞工程與指令遵循上的大幅強化。Wan 3.0 能夠將使用者的提示詞轉化為調度輸入、控制表達的中樞,讓文字、圖片、音訊、影片四種基礎模態之外,還能讀取並理解文檔中的結構化資訊。
這項技術使 AI 視頻生成從內容創作工具進一步升級為生產力工具,滿足企業在產品演示、內部培訓、市場行銷等多樣化場景的需求。在畫面真實性方面,Wan 3.0 力求精準還原真實世界。模型能夠生成「千人千面」的人像,對五官與皮膚細節的刻畫更加敏銳,人物情緒表達自然克制,微表情與肢體動作之間也能彼此聯動,避免過去 AI 影片常見的僵硬感。在「全能參考」任務中,角色、道具、聲音、空間關係、風格等細粒度維度都能穩定保持,不會因為場景切換而出現不一致的現象。此外,Wan 3.0 對於數字化資訊的畫面審美也同步提升。
無論是圖表、數據還是使用者介面內容,在生成影片中都能呈現出應有的質感,不再只是粗糙的貼圖或模糊的數字。這對於需要製作教學影片、數據報告動畫、產品介面展示的使用者來說,是一大福音。在影片編輯方面,Wan 3.0 同樣獲得顯著升級。使用者可以修改畫面中的元素、調整劇情走向,甚至改變角色的臺詞,讓後期製作更具彈性。不過,目前版本在聲音質感與文字準確度方面仍有改善空間,官方表示會持續優化。正式公測即日起開放,使用者可以透過阿里雲百鍊、萬鏡一刻、萬相官網、千問創作 PC 端、IF STUDIO 以及堆友等平台直接體驗。同時,千問 App 也開始灰度開放測試。對於開發者與企業用戶,Wan 3.
0 的 API 價格也已公布:480P 解析度為 0.3 元/秒,720P 為 0.6 元/秒,1080P 為 1.2 元/秒。API 接口預計在近期全量開放,屆時將有更多應用場景能夠接入這項生成能力。整體來看,阿里 Wan 3.0 的推出標誌著視頻生成模型正從單純的創意工具,邁向能夠處理結構化資訊、支援真實場景還原的綜合性生產力平台。隨著文檔輸入、長時生成、精準參考等功能的成熟,AI 影片在商業、教育、行銷等領域的應用潛力將進一步釋放。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。