陸川手搓歷史現場,王珞丹熬夜抽卡,阿里全模態開始兜底生產

阿里:三年之內會出現一個原生的全模態統一生成模型,未來體驗將不再受限於模態邊界。田晏林 發自 凹非寺 | 公眾號 QbitAI 5天。不用搭景,不用等演員,導演陸川和團隊,直接用AI把一場發生在400年前的明代災難現場,搓出來了!宮廷、火藥庫,還有史料中煙雲如黑靈芝的大爆炸。按照傳統影視工業的做法,這樣的場景復原往往需要數月時間和千萬級投入。但這次,他們只用了5天!來,話不多說,先看短片。「鏈接」 怎麼樣?夠猛吧?人物的臉、皮膚、神態已經相當逼真,幾個明代人物也不再是過去那種一眼AI的塑料感。再看爆炸。煙塵、碎片、火光一起往外衝,這種最容易穿幫的複雜場面,也都穩穩接住了。
要按傳統影視工業的路子來,過去光是一場爆炸戲,就要耗費19天。這次,陸川團隊把史料裡的文字一點點翻譯成現代視覺概念,前後大約做了四輪提示詞優化,再參考真實爆炸影像去校準。最後,阿里視頻生成模型對煙塵、碎片這些複雜畫面的還原,準確度已經達到團隊預期的95%以上。現在的AI已經進化到不只是給導演吐幾段素材而已了。從史料蒐集、畫面製作到主題討論,它開始進入完整創作鏈路;單在視頻生成環節,阿里模型的貢獻度就超過了一半。9月22日,在雲棲大會上,阿里雲又來了一波大的,直接把模型家底都端了上來。先看千問基座模型,架構、自我進化、全模態、參數規模,幾乎每一層都在往前推: Qwen3.
8-Max開始自己訓練自己,Qwen3.8-Flash提前放出下一代架構,Qwen3.8-Omni為大模型開闢全新的思考分區,Qwen4已經開練,Qwen4.5、Qwen5也在路上。而且,參數規模更是直接瞄準5萬億~10萬億。另外,圖像生成模型Qwen-Image-3.1、音樂生成模型Happy Shrimp 1.1、世界模型HappyOyster 2.0 Preview、語音模型家族Qwen-Audio-3.1、同聲傳譯模型Qwen3.8-LiveTranslate也集體亮相。下一代視頻生成模型則預告將於11月發佈。單拎哪個模型出來,都能講半天。但結合陸川的短片,放在一起看,味道就不一樣了。
阿里這一輪全模態升級,已經不太像是在補單項能力。它更在意的,是這些模型能不能更快進入場景,變成真正的生產力。阿里的全模態拼圖,基本鋪齊了 把這次雲棲大會的模型更新全部攤開,一張相當完整的全模態地圖已經擺在眼前。文字和通用智能這邊,有Qwen3.8,以及已經投入訓練的Qwen4。往外看,圖像生成與編輯有Qwen-Image-3.1;視頻生成有Wan、Happy Horse系列,以及計劃11月發佈的下一代視頻模型;聲音這邊是Qwen-Audio-3.1,音樂則交給Happy Shrimp 1.1。再往真實世界延伸,HappyOyster 2.
0 Preview開始處理世界模型和交互環境;Qwen3.8-Omni-Flash把文字、圖片、音頻、視頻放進統一理解框架;Qwen Intelligence繼續把Agent能力推向手機終端。這一串名字看下來,很容易有種新品發佈會開到停不下來的感覺。可把它們塞進一項具體任務裡,關係就清楚多了。拍一條廣告,腳本、商品圖、人物、口播、音樂,本來就混在一起;做一部電影也一樣。導演給模型的可能是一段文字、一張參考圖、一首音樂,最後交付的是一套完整的視聽內容。現實任務天然就是混合模態的。文字、圖像、視頻、聲音、空間信息往往同時出現,模型最終要處理的,也很少是一種單獨的信息。
現實任務不分模態,模型也很難再一項一項地做。雲棲大會現場,阿里巴巴ATH事業群副總裁、淘天集團首席科學家鄭波提到: 文本、圖像、視頻、聲音、空間的能力正在加速協同,AI也從生成一張圖、一段視頻、一首音樂,繼續走向理解人的意圖,創造完整沉浸式視聽體驗。阿里方面判斷:如果語言模型是機器的大腦,多模態模型正在成為機器感知世界、創造內容並與物理世界互動的中樞。這時候再回頭看阿里這一整套模型佈局,關係就更清楚了。
Qwen負責語言、知識和推理;Image、Wan、Happy Horse、Audio、Happy Shrimp把能力往視覺、影像、聲音和音樂延伸;HappyOyster再往三維空間和交互環境裡走。Omni繼續處理不同模態之間的統一理解,Agent則把這些能力接進實際任務。當這些能力開始被放進同一條任務鏈裡,評價標準也跟著變了。一張圖生成得多漂亮,一段視頻有多炸裂,依然重要。到了生產環境裡,還會多出一長串更現實的考題。能不能穩定交付,能不能連續工作,能不能理解同一個任務?從Demo走進生產線,多模態開始接受真考驗 這些問題,只有進了真實工作流才會徹底暴露出來。
第一層:內容生產 這是最成熟的一層,也是視頻模型最先撞上的考題。Wan3.0已經支持單次30秒生成,還能接受文檔、表格、網頁等結構化輸入。據阿里披露,它曾經在Artificial Analysis的文生視頻和視頻編輯兩項榜單上位列第一。但到了商業場景,榜單隻能算入場券。比如廣告,一條片子裡的商品外觀、Logo、人物和口播只要有一個漂掉,前面生成得再炫也很難直接交付。這套更苛刻的指標,同樣落在了圖像、語音、音樂等其他模態上。「能不能穩定生產」,已經成為多模態進入生產環境後的核心考題。不過,Wan3.0已經拿到正向反饋了。據使用者介紹,Wan3.0已接近真實廣告拍攝水平。
第二層:進入專業創作 陸川的《歷史·現場》就是一個很典型的樣本。5天重建一場400年前的歷史現場很驚豔,但這次嘗試更有意思的地方,其實是它把AI帶到了創作者真正難啃的位置。通用模型很容易生成大家熟悉的古裝劇質感,真正的歷史現場反而需要陌生感,需要更嚴謹的史料,也需要模型理解導演到底想表達什麼。對此,阿里巴巴視頻生成模型技術負責人表示,未來將與更多導演、行業專家及歷史學者合作,為模型引入更全面、更嚴謹的專業信息。到了這裡,模型面對的已經不只是畫面質量,還要開始理解專業知識和創作意圖。音樂創作遇到的則是另一套難題。
9月22日下午,在2026雲棲大會的視聽分論壇上,太合音樂集團總裁餘灝坦言,AI給音樂行業帶來的焦慮並不新鮮。電子合成器、MIDI(樂器數字接口)、DAW(數字音頻工作站)都曾經引發過類似擔憂,但最後都變成了新的生產工具。而現在,AI又把音樂創作成本往下壓了一大截,普通用戶和專業藝人都開始把它當生產力工具。但音樂一旦進入產業,問題馬上變得比「能不能生成一首歌」複雜得多。訓練素材怎麼獲得,版權怎麼算,AI翻唱該不該授權,收益怎麼分,這些都繞不過去。太合和阿里Happy Shrimp的合作,也開始往音樂人共創、產業生態、版權機制和AI音樂新消費場景延伸。
餘灝特別提到,無授權AI翻唱的成本太低,大量版本氾濫,會直接侵蝕原版版權方和藝人的價值。這時候,AI音樂已經從一個創作工具,進入到了產業規則這一層。小旭音樂創始人盧小旭在論壇上的分享,更像是一張「多模態生產流程圖」。他的工作室做AI歌手,單靠一個模型根本跑不下來。先做人設和視覺錨點,再用音樂模型做歌曲、人聲和編曲,接著把音樂交給視頻模型做MV和對口型視頻,後面還要接大模型做評論抓取、分類和運營反饋。整個流程本身,就是一個多模型協同工作流。不過,這套生意還遠沒到閉眼複製的階段。盧小旭提到,他們平均4個項目才能跑出1個成功AI歌手賬號。但小團隊的生產效率,在阿里多模態模型的加持下,已經被明顯拉高。
據他透露,其團隊6個人就能孵化十多個AI歌手IP,一些賬號4個月漲粉20萬,全網累計播放量突破2億。這幾個案例放在一起看,會發現專業創作對模型提出的要求完全不同於普通生成。電影要理解導演意圖,音樂要處理版權和產業規則,AI歌手還得把音樂、視覺、人設、運營串成一整套工作流。進入專業創作之後,多模態拼的已經不只是生成質量,還要能吃進專業知識,理解創作目標,並接進完整生產流程。第三層:進入終端和物理世界 再往外走,多模態開始離開內容產業。目前,千問端到端全雙工實時語音交互大模型Qwen-Audio-3.
1-Realtime,已經進入千問辦公、Qoder(阿里智能體編程工作臺)、千問AI眼鏡、隨身助理和桌面機器人等,能夠邊聽、邊想、邊說。Qwen Intelligence繼續把Agent能力塞進手機,希望完成跨應用複雜任務。HappyOyster 2.0 Preview則把戰線拉到了物理世界。它要解決的是另一類問題:環境能不能長期保持一致,物體運動能不能符合物理規律,用戶操作後能不能及時得到反饋。這張多模態佈局圖已經越來越清楚:先給人生成內容,再幫人完成工作,接著讓機器真正理解並作用於世界。但問題在於,這麼多單項能力越來越強,AI怎麼才能在一件複雜任務裡,一直記得自己到底在幹什麼?
多模態的下一關,是連續理解和完成任務 這個問題,在創作者那裡已經出現了。演員王珞丹在視聽分論壇現場分享了她的AI創作體驗。圖源王珞丹微博 今年年初,她開始認真學AIGC,自己下場做短片。最開始,她連人物三視圖都要一點點學。再往後,是排隊、抽卡、反覆試。王珞丹曾經抽卡抽到凌晨4點,一度覺得很絕望,到了早上6點,終於抽到了想要的鏡頭。但更麻煩的是表演。她的腦子裡明明有一個很具體的狀態,模型卻很難準確呈現。反而在給一個寬泛概念時,模型倒有可能突然給出驚喜。這很能說明現在多模態創作的一個尷尬: 儘管單個鏡頭已經越來越強,但故事一長,人物的狀態、情緒和氣質很難一直保持。
但創作者需要的,恰恰就是AI能記住前面的內容,一直跟著同一個故事往下走。放到更廣泛的Agent任務裡,則是記住上下文、環境變化,以及前面已經執行過什麼。問題到這裡就很清楚了。圖像、視頻、語音、世界模型分別變強,只解決了單項能力。但一項完整任務,往往同時包含視覺、聲音、語言、空間、時間和動作,而且這些信息還會一路變化。AI需要在這些信息之間保持同一個任務上下文。每切一次模態,就像重新開始一次對話,這種方式很難撐起真正複雜的工作。這也是多模態下一階段最重要的一道題:各自很強之後,怎麼開始一起工作?
多模態走到下一階段,看的已經不只是能不能看、能不能聽、能不能生成,更要看它能不能圍繞同一個目標持續理解。阿里把更遠的方向指向了「原生全模態統一模型」。鄭波給出了一個判斷: 三年之內會出現一個原生的全模態統一生成模型,未來體驗將不再受限於模態邊界。重點在「原生」。今天,很多多模態系統,更像是一場接力。圖像模型做圖,視頻模型接著生成,音樂模型負責聲音,Agent再去調不同工具。能力都能用,但一次次交接,也意味著上下文可能丟失。原生全模態想解決的,就是這種割裂。不同模態從模型底層共享同一個任務、同一份上下文和同一套世界理解,圖像、視頻、聲音、空間、動作都圍繞同一個目標往前走。
據瞭解,阿里的下一代視頻模型已經沿著這條路繼續推進。新模型將在11月發佈,方向之一就是從生成單個鏡頭走向理解完整敘事。阿里往前探索了一步,鄭波把這個方向稱為「Agentic Video」。意思是,模型開始理解創作目標和創作意圖,從一個想法、一段故事出發,自動拆劇情、做分鏡、組織角色和場景,再完成生成。這和今天的「抽卡式創作」已經是兩種體驗。今天,創作者還得反覆重講人物、風格和情緒。但理想狀態則是把故事和角色講清楚一次,AI就能記住全片設定,一路跟下去。王珞丹熬夜抽卡的經歷,暴露的正是多模態創作最後一公里的問題。但陸川的《歷史·現場》,已經讓另一種可能開始出現。
AI可以真正進入專業創作鏈路,並承擔相當一部分生產工作。只是今天,這條鏈路還需要導演和團隊在中間不斷組織:查史料、定視覺、調提示詞、校準畫面,再把不同模型的能力接起來。原生全模態想繼續往前走一步,讓AI不只接住一個鏡頭,而是接住一整件事。這意味著,AI要從理解創作意圖,到記住人物、場景和敘事,再到調用圖像、視頻、聲音乃至空間能力持續完成任務。這樣再回頭看阿里這一輪密集的多模態更新,真正值得關注的,也就不只是又多了幾個模型。一張更大的拼圖已經鋪開。接下來要比的,是誰能把這些能力真正擰到一起,讓AI從會生成,走向會把事情做完。版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

Meta Muse 爆紅,為什麼騰訊股價大漲?
Meta Muse 爆紅,為什麼騰訊股價大漲?深流研究所2026.09.23 10:39 · 來自北京全文3733字00:00 / 10:34扎克伯格等來爆款,騰訊跟著被重估。文 | 深流研究所,作者 | 吳絳楓Meta 在 AI 上砸下的重金,什麼時候才能拿到大結果?Muse 給出了第一個答案。9 月 8 日,Meta 推出個人 AI Agent Muse。上線不到兩週,Muse 登頂美國蘋果應用商店免費應用榜,排名超過 ChatGPT、Gemini 和 Claude。扎克伯格終於等來了一個消費級 AI 爆款。9 月 21 日,Meta 股價上漲 11.43%,創下 2025 年 4 月以來最大單日漲幅,市值一天增加約 1900 億美元。Muse 點燃的不只是 Meta。市場開始押注,個人 Agent 的普及會帶來更大的推理和計算需求。於是,Arm 上漲 17.2%,英特爾上漲 12.1%,AMD 上漲近 10%,市值首次突破 1 萬億美元。這輪行情很快傳到中國。9 月 22 日,騰訊控股盤中一度上漲 7.77%,股價升至 463.4 港元。在當天普遍上漲的港股科技股中,騰訊表現最突出。Muse 有什麼特別之處?它為什麼能讓華爾街重新相信扎克伯格,又為什麼讓遠在中國的騰訊獲得重估?為什麼說Muse是“社交+Agent”?從產品體驗看,Muse 完成表格填寫、日程整理、預訂餐廳、規劃旅行及購物等一系列任務。接到任務後,它會將目標拆解為多個步驟,再調用用戶已經授權的賬戶和服務。涉及發送郵件、提交訂單和付款等敏感操作時,Muse 會暫停執行,等待用戶再次確認。說實話,這些能力本身並不新鮮。OpenAI、Google、Anthropic,以及一批創業公司都有嘗試。Muse 的不同之處在於,Meta 第一次把個人 Agent 放進一個成熟的社交體系,嘗試藉助 Instagram、F

Opus 5.5來了,性能趕超Fable,成本低至40%
Opus 5.5來了,性能趕超Fable,成本低至40%字母AI2026.09.23 10:31 · 來自北京全文4730字00:00 / 12:20被Astra“逼出來”的全新系列。文 | 字母AI5.5!!是Opus 5.5!!就在三天前,路透社還報道稱,隨著GPT-6 Astra開始搶回企業市場,Anthropic正在考慮提前推出一款新模型應戰。社區一直猜測新模型會是Opus 5.2還是5.5,現在答案終於揭曉了。而且這不是一個小更新,Anthropic直接掀開了Claude 5.5這個新系列。Opus 5.5先打頭陣,Sonnet 5.5和Haiku 5.5也已經排在後面,將在幾周後推出。某種意義上,Astra這腳油門踩下去,Anthropic連換代速度都被一起帶快了。和新模型同時到來的還有一個重置,正好方便用戶體驗。 Fable的定位有點尷尬了 既然被認為是衝著Astra來的,那就把它和Astra放在一起看。先說價格,Opus 5.5的API輸入價格是每百萬Token 4美元,輸出20美元;Astra則分別是10美元和50美元。也就是說,Opus 5.5的Token單價只有Astra的40%。兩款模型的上下文沒太大差別,Opus 5.5是100萬Token,Astra是105萬;最大輸出也都是128K Token。Astra的知識截止日期是2026年4月30日,Opus 5.5則更新到了2026年6月。兩款模型均支持low到max五檔推理強度。而且Opus 5.5相比自家上一代Opus 5也降價了。Opus 5原本是每百萬Token 5美元輸入、25美元輸出,新模型兩邊都降了20%;Anthropic稱,再加上Token使用效率提升,完成一項典型任務的實際成本能比Opus 5低約40%,輸出速度則提高了30%以上。便宜歸便宜,Opus 5.5在跑分上倒是一點沒客氣

OpenRouter發佈 2026 嵌入模型選型指南:實測 19 款、 37 個目錄條目,按場景把最佳候選擺上桌
正因如此,選哪個模型永遠是RAG、多語言檔案庫、代碼倉庫和圖文集合各自不同的考題。OpenRouter在9月11日核實了自家嵌入模型目錄,共37個條目,並通過embeddings API向19個模型發了批量請求、跑了28項檢查,用一份實測指南把選型邏輯攤開。

AI變天,Kimi怎麼補齊“月之暗面”?
光錐智能2026.09.23 10:15 · 來自廣西全文7430字00:00 / 20:20模型強只是入場券,月之暗面還需要補更多課文 | 光錐智能,作者|魏琳華,編輯|劉俊宏AI圈的規則就是用來打破的,市場變化之快,讓公司們經常猝不及防。

DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰
據路透社援引知情人士消息報道,中國人工智能初創企業 DeepSeek 預計將於本週向聯合國安理會就人工智能所帶來的潛在風險與安全挑戰進行專題通報。作為全球矚目的前沿 AI 力量,此次 DeepSeek 受邀參與聯合國安理會的安全通報,折射出國際社會對中國大模型企業在技術治理、風險防控以及全球 AI 安全框架建設中發揮實質性作用的重視。

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026
本文作者: 叢末 2026-09-23 09:49 導語:只靠語言和 token,AI 永遠跨不過物理世界這道門檻!只靠語言和 token,AI 永遠跨不過物理世界這道門檻!作者丨幸麗娟 編輯丨岑 峰 AI 行業的主敘事,曾被 Scaling Law 壟斷:更大的模型、更多的 token,更強的文本推理,彷彿只要把語言模型繼續堆大,通用人工智能就會自動到來。