這,可能是今年WAIC最驚豔的圖片!

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 這,可能是今年WAIC最驚豔的圖片!
在上海世界人工智慧大會(WAIC 2026)現場,商湯科技端出了一項讓人眼睛為之一亮的新成果:日日新 SenseNova U1 Pro 模型。官方展示的一張超長 8K 圖立刻抓住全場目光——畫卷主題為「WAIC 九週年 2018—2026」,從左到右逐年展開,每屆亮點濃縮其中。更驚人的是,放大檢視後,字跡清晰、細節完整,完全不像過去 AI 生圖常見的糊字或結構錯亂。這背後不只是一張高解析度圖片,而是商湯試圖重新定義「生圖」這件事:從「畫得像」走向「直接把成品交給你」。U1 Pro 是一套針對複雜多模態任務的交付系統,核心邏輯是「理解、生成、行動」三位一體。
它不只要產出一張圖,而是理解目標、規劃任務、組織資訊、執行生成、檢查錯誤、修正細節,最後交付可用的結果。商湯把這套流程濃縮為三大亮點:原生 8K 輸出,超高畫素之外更能維持超大畫幅內的字體、構圖與紋理;圖文交錯思維,模型會自己打草稿、細化、著色、檢查和調整;面向成品交付,瞄準資訊圖表、都市規劃、影視分鏡、學術海報與商業設計等真實場景,減少反覆抽卡的痛苦。為了驗證 U1 Pro 的真實能耐,現場實測連丟四道難題。第一關是「二十四節氣」8K 長圖。模型要把 24 個節氣名稱按順序排入橫向長卷,每個節氣搭配對應的物候與季節色調,還要保持整體視覺連貫,從春到冬色彩自然過渡。
結果 U1 Pro 端出的畫面中,每一格的山水高低、植物位置與留白都有變化,形成類似屏風與長卷交織的節奏感,證明它確實能駕馭超長圖幅的細節控制。第二關挑戰「高級實驗室視覺海報」,主題為「機器如何觀察和理解人類」。模型必須在畫面中央呈現背對鏡頭、略微側身的人物,頭部與上半身疊加檢測框、座標軸、幾何圓、運動軌跡等科技元素。出乎意料的是,U1 Pro 沒有掉入科技藍的套路,而是以暗金線條、黑色背景與紙張顆粒感構成強烈視覺層次,資訊量高卻不雜亂。第三關是琉璃質感的古風建築山河圖。
Prompt 同時要求青綠山脈、藍色河流、瀑布、寶塔、山門、亭臺、廊橋、宮殿、桃花林、松樹、祥雲,以及一座帶東方結構語言的未來建築;材質上要像琉璃、玉石與琺琅共同燒製,表面有流動高光與釉面層次。U1 Pro 把琉璃山體、水系、古建與未來建築成功熔於一爐,展現對複雜風格指令的執行力。第四關回歸商業實戰,要求設計一張可直接上映宣傳的原創電影海報,氣質介於東方詩意、懸疑史詩與現代藝術電影之間。最終成果字字清晰,整體完成度直接達到商用等級。四道題看下來,U1 Pro 最突出的能力並不是單純的解析度升級,而是圍繞一個完整目標組織畫面,把資訊、版式、人物、材質與風格放進同一趟產出流程。
商湯 CEO 徐立在發表會上點出目前生圖工具的痛點:「能交互,不等於能交付。」很多模型已經可以透過自然語言反覆修改,但任務一複雜就容易失控——改好一個局部,其他區域跟著變;畫面看起來專業,文字與結構卻經不起細看。U1 Pro 的解法,是把一次生圖拉長成一整套連續創作流程。商湯聯合創始人、首席科學家林達華在會後交流時透露,團隊早在 U1 階段就觀察到「連續創作」的雛形:模型可以先畫草圖,再逐步補充細節、著色。這讓他們看見視覺模型有機會接近設計師的工作模式,把生圖推向真正的內容設計生產環節。要達成 8K 直出,背後技術難度遠高於增加像素數。
解析度提升會讓視覺 Token 數量暴增,注意力機制的運算量與顯存佔用隨之激增。商湯的關鍵解法之一是採用 32×32 的大 Patch(常見模型為 16×16),邊長放大一倍後視覺 Token 總量降到四分之一,大幅減輕計算負擔。但大格子容易丟失細節,因此團隊加入自適應 Noise Control,對細節區域使用針對性訓練策略;同時保留 Patch 之間的部分重疊,並在空間取樣、損失函數與模型結構上全面優化,在降低運算量的同時盡可能保住小字、紋理與結構。從產業角度來看,U1 Pro 對應的是一次產品範式轉移。
林達華以 AI Coding 的演進路徑做類比:最初 Copilot 幫助開發者補全程式碼,接著 Vibe Coding 讓用戶用自然語言表達需求,再進化到 Coding Agent 自行拆解任務、寫程式、呼叫工具、測試並修復。模型價值從「寫了多少行程式碼」轉向「能不能把專案做出來」。多模態內容生成正經歷相似變化——從單點生圖、意圖驅動修改,到如今的系統級內容交付。模型不只產出一張圖,而是理解目標、組織資訊、保持長程一致性、檢查錯誤,最後交付可用的結果。當然 U1 Pro 並非完美。
非同步生成意味著使用者必須用等待時間換取更高完成度;編輯能力、成本與穩定性仍需真實專案驗證;專業設計場景不可能只靠一張最終圖片,圖層、向量元素、版本管理與團隊協作同樣重要。但方向已經很清楚:當生圖告別反覆抽卡、開始對結果負責,多模態 Agent 的競爭才真正鳴槍起跑。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。