對話商湯林達華:多模態是 Coding 之後的下一個戰場
重點摘要
能交付商用才是真生產力 作者丨高允毅 編輯丨馬曉寧 7月18日,在2026年WAIC大會上,商湯科技承辦的“基座大模型架構創新與生態合作論壇”如期舉行。大會之前,在喧囂的會場之外,《AI科技評論》拜訪了商湯科技首席科學家林達華。
在2026年WAIC大會期間,商湯科技承辦的「基座大模型架構創新與生態合作論壇」於7月18日登場。大會前夕,商湯科技首席科學家林達華接受了《AI科技評論》專訪。當被問及語言模型高度成熟後的下一個決勝戰場時,他沒有搬出複雜的Benchmark,反而指向辦公室內一盆矮腳綠植:「你能用語言向我描述清楚這盆盆景每一片葉子的精確位置嗎?」他進一步解釋,大量感知細節無法靠語言窮盡,人眼一瞬看清的內容,語言往往說不清楚。這記「盆景之問」正好點出大語言模型面對真實物理世界的邊界——從高級審美、三維佈局到自動駕駛與具身智能,凡是需要理解物理空間的場景,都離不開真正的視覺能力。而人類大腦本就是語言與視覺深度融合的產物,從這個第一性原理出發,商湯押注的下一個戰場正是多模態。 當前AI Coding已成為頭部廠商瘋狂內卷的戰場,Anthropic等公司因程式碼模型身價倍增。外界不免好奇,商湯為何不跟風搶奪這波紅利,反而大談多模態?林達華認為,AI Coding確實是商業化最成熟的賽道,但純文本語言的天花板已經清晰浮現。「你用任何一款程式碼模型寫前端網頁,一眼就能看出是AI生成的,和具備『蘋果級』質感的現代產品界面有著明顯差距。」高級設計感與空間美學無法純靠程式碼邏輯實現,這正是純文本Coding的天然盲區。業內最敏銳的巨頭早已悄悄轉向:以編程能力見長的Anthropic,在Opus 4.8版本中重點強化多模態元素。林達華指出,當後端邏輯程式碼的能力趨同、價格戰白熱化,前端體驗與視覺交互自然成為下一階段競爭高地,商湯選擇發揮自身視覺積累的絕對優勢,而非在純文本領域硬碰硬。 針對「未來AI Agent會以純文本命令行(CLI)交互,多模態價值不高」的觀點,林達華並不認同。他強調,只要人與AI持續共存,視覺交互就是不可替代的核心載體,「CLI是面向機器的,視覺才是面向人類體驗的。」從辦公彙報、海報設計到遊戲開發、影視製作,這些高頻大眾場景的本質都離不開視覺。要打造能在物理世界中思考、行動的「全能智能」,必須讓視覺與語言在底層大腦中融為一體。商湯自研NEO-unify原生統一架構的核心初衷正在於此。但這並非易事:語音與文本屬於同構模態,可直接映射;視覺與語言則是完全異構模態,像素無法簡單對應文字詞元,攻克異構融合一直是多模態領域的核心難點。 長期以來,主流多模態大模型走的是「拼接式架構」——在成熟語言模型外掛獨立的視覺編碼器等模塊,本質是先將圖像「翻譯」成文本再交給語言模型。這種方案工程門檻低、訓練快,但技術天花板也低,翻譯過程會損耗大量空間與感知細節,並不是「真正看見」。林達華帶領的團隊很早就看到拼接架構的侷限,並持續尋找原生統一模型的可能性。他們認為多模態的終極形態是讓不同模態擁有共同的內核語言與統一表徵,像人類大腦般順暢深度溝通。2025年中,團隊聯合南洋理工大學S-Lab用小規模數據驗證了原生融合設想;同年9月發表論文,首次系統闡述徹底移除視覺編碼器的原生多模態NEO架構;2026年3月發布升級框架NEO-unify及相關論文,描述端到端原生統一模型的宏大設想。 在NEO-unify架構中,商湯徹底移除了主流模型普遍依賴的視覺編碼器與變分自編碼器,讓模型直接從像素和文字中學習,不再需要「翻譯器」。支撐其運轉的是一套自研的Mixture-of-Transformers(MoT)架構,語言與視覺信息在每一層計算中深度交融。這種從架構層面的重構,意義堪比Transformer之於大語言模型。令人驚豔的是,NEO-unify僅需約3.9億圖像文本示例(約為業界同等性能模型十分之一的數據量)就湧現出頂尖的視覺感知與推理能力。開源版本的SenseNova U1正是這套架構的成果,擁有真正的「圖文交錯思維鏈」,可在同一個上下文裡同時生成文字與插圖,確保風格與內在邏輯高度一致。在同量級開源模型中,僅以8B參數起步的U1便斬獲SOTA性能,部分表現跨代直逼主流大型閉源模型。 在大會當天,商湯進一步推出可交付級別的旗艦模型SenseNova U1 Pro。作為全球首個以「理解、生成、行動」原生統一為內核的多模態工具,U1 Pro具備內生的圖文交錯思維,可直接輸出高達原生8K頂級畫質的成片,在設計領域正面對標GPT-Image-2等頂尖模型。林達華將U1 Pro定位為一款在審美與設計能力上都達到一定高度的產品,背後是漫長且嚴苛的專業化淬鍊。團隊敏銳鎖定「信息圖」(infographic)賽道,並以驚人速度高頻迭代:infographic-V1在底層算力全面重構,信息密度與排版質感顯著提升;infographic-V2攻克了以往字數一多畫面就糊、連字錯字的行業頑疾,大幅提升小字清晰度與排版精度;infographic-V3重磅引入可編輯功能,讓用戶可隨時修改畫面細節。 要讓AI具備真正的專業設計能力,必須用上億道「魔鬼級」設計題去餵養。由於現實世界極少存在自帶密集資訊與複雜排版的完美數據,商湯構建了規模過億甚至逼近數十億級的超大型多模態題庫,單張設計圖對應的文字描述往往長達上千字。預訓練階段,模型吞入數十億級圖文原生交錯數據;持續預訓練階段以高比例合成數據為主,在高強度訓練中拉拔專業設計能力;後訓練階段則精選千萬量級黃金數據精雕細琢,淬鍊出成品級交付質感。支撐這一切的正是商湯內部由超級Agent驅動的自動化數據合成管線。 為了達到「交付級」品質,商湯設計了一套稱為「視覺拆解思維鏈」的學習模式。拿到高質量海報後,模型會自動拆解全部視覺組件,逆向推理設計師的版式佈局邏輯與色彩搭配思路,生成完整設計思維鏈進行學習,不僅學形似,更抓神韻。生成圖片時,U1 Pro採用多輪智能體生成閉環:先基於需求拆解資訊、規劃版式,形成完整方案;再靠內生能力完成全圖生成;最後啟動全局自檢,識別文字錯誤、佈局瑕疵與審美問題,不斷反向迭代修改,直到符合交付標準才輸出成品。商湯還組建了一支由200名美院學生與專業設計師組成的「人類審美團」,每天對著U1 Pro生成的作品找茬打分,像設計公司新人被反覆「毒打」後自然懂得高級感何在。 評判模型好壞時,林達華的標尺只有一個:交付率——生成內容無需大幅修改即可直接商用,達到付費專業設計師的出品標準。他公布U1 Pro最新交付率穩定在70%。60%是商業可交付基準線,目前全球僅有兩個模型超越這一標準:一個是商湯U1 Pro,另一個是OpenAI的GPT-Image-2。70%交付率背後是全維度品控,文字錯誤率控制在千分級,圖形元素、空間佈局、色彩搭配等細節錯誤也同步壓在千分級內。根據Precedence Research報告,2026年全球設計領域生成式AI市場規模約13.3億美元,企業客戶佔比超過47%,是AI設計工具的最大買方。林達華直言,學術界生成一張圖錯一個字也許還能打99分,但在真實商業世界,錯一個字的那張圖就是廢紙,只能得0分。U1 Pro的系統性突破正將AI設計從「花架子」推向真正的商業交付。 在訪問中,林達華透露U1 Pro已具備初步空間推演能力,例如能玩魔方,意味著這款「設計師」模型開始觸摸三維世界。在商湯版圖裡,世界模型並非與多模態底座平行,而是視覺與語言深度融合基座上自然長出的分支,像Transformer底座能長出各種LLM一樣。商湯「1+X」戰略下孵化的生態企業大曉機器人,近期推出「開悟」世界模型,其底層技術依然是同一個多模態底座,只是在訓練中提高具身數據比例。7月13日,商湯還發布了統一理解與生成的視覺大模型SenseNano-Vision,讓視覺成為通用基礎模型的原生能力,在目標檢測、圖像分割、深度預測、3D重建等經典任務上展現超越專用模型的實力。 展望未來,林達華透露下一代U2將真正走向三維。如果U1還停留在二維平面設計,U2將融入影片的理解與生成,把感知、理解、生成、行動全部一體化,「也許再下一個版本,你給它一張設計草圖,它能把整個建築造出來。」更終極的形態是將模態從視覺、語言擴展到數十種傳感器信號,那才是大家認為最完整的世界模型。然而,物理規則的複雜性超乎想像,未來還需納入人類社會學等更多維度。每新增一個物理屬性維度,數據組合量級就會指數級暴漲,算力和儲存將成為瓶頸。林達華提出解題思路:或許應對世界屬性進行解耦,拆分出專用子模型有機組合、協同推理,而不是窮盡所有數據組合。當被問到最想帶團隊攻克的下一個技術山頭是什麼,他毫不猶豫地回答:「物理世界的AGI。」在那個說不出的智能最堅硬之處,商湯的拓荒腳步仍在加速前進。
Related
相關文章

月之暗面的“凡爾賽”公告
月之暗面的“凡爾賽”公告下海fallsea2026.07.20 16:37 · 來自湖北全文4834字00:00 / 12:31在AI的深水區,浪漫屬於極客,但生存屬於會計。文 I 下海fallsea,撰文I胡不知7月19日深夜,當無數C端用戶正準備用Kimi K3的100萬上下文窗口“白嫖”長文檔分析時,月之暗面悄然拔掉了網線。一份名為《關於算力緊缺與會員暫停開放的說明》的公告被掛在官網。

27億,AI 3D生成領域最大單筆融資誕生
這篇消息聚焦「27億,AI 3D生成領域最大單筆融資誕生」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

WAIC之外,一張AI人才圖譜正在知乎形成
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> WAIC之外,一張AI人才圖譜正在知乎形成 量子位的朋友們 2026-07-20 16:06:22 來源:量子位 今年WAIC再次匯聚全球AI企業、科學家、創業者和開發者,成為觀察AI產業發展的最佳窗口。 在WAIC大會上,最受矚目的依然還是大模型、人形機器人和AI Agent。但如果把目光從展臺移開,一個比新品發佈更值得關注的變化正在發生: AI產業的競爭,正在進入”人才時代”。 從大會議程來看,”人才生態”已經成為出現頻率最高的主題之一。從論壇設置到創業展示,討論的焦點也正在從”模型有多強”轉向”誰在推動AI真正落地”。 正是在這樣的背景下,知乎在WAIC舉辦了Tech Club知乎新知科技大會,以”AI的最後一公里,還要走多久?”為主題,攜眾多知乎AI答主、開發者和創業者展開討論。 從活動現場延伸到社區討論,人們看到的不僅是一場行業峰會,更是一張不斷生長的AI人才圖譜。 一張覆蓋AI全產業鏈的人才圖譜,正在知乎形成 最前沿的人,在知乎發佈AI 最近一年,一個明顯變化正在出現。越來越多AI企業在發佈模型之後,不再滿足於僅僅召開發佈會,而是選擇走進知乎,與開發者展開面對面的技術交流。 去年3月,DeepSeek在知乎開設官方賬號,首次公開了其推理系統的核心優化細節。DeepSeek沒有停留在”發佈技術成果”,而是在知乎詳細解釋了模型如何實現更高吞吐、更低延遲,並回應開發者對於推理效率、成本利潤等問題的討論。 同樣的事情還有更多。Kimi K2在去年7月發佈後,月之暗面(Moonshot AI)的工程師與研究員們集體湧入知乎,以“親自答”和“發帖”

中軟國際與月之暗面簽署協議,達成 Token 分成及聯合創新合作
首頁 > 智能時代>人工智能 中軟國際與月之暗面簽署協議,達成 Token 分成及聯合創新合作 2026/7/20 15:52:49 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 不一樣的體驗 的線索投遞!

大模型給圖片打分不再“靠嘴說”,結構圖、頻譜圖當“物證”,用“視覺證據”來給圖片打分
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

一個週末,AI黑掉了AI,這劇情太科幻了
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。