Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差

2026年8月4日 14:42
Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差

重點摘要

# Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差 Coding之外,關於原生多模態的爭論從未停止 文 | 李炤鋒 編輯 | 張雨忻 “長鏈任務如果只通過代碼層面的反饋,誤差可能會不斷累積,最終效果會非常差。”談及原生多模態的意義,一位多模態研究員表示,“視覺是一種更準確的反饋,也更貼近用戶意圖。” 過去一年,Coding與Agent能力不斷改寫大模型的排名,也成為AI最快兌現商業價值的場景之一。與此同時,隨著Agent開始接管更多長鏈任務,越來越多的通用大模型開始匹配原生多模態能力。

站內 AI 整理稿

# Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差

Coding之外,關於原生多模態的爭論從未停止

文 | 李炤鋒 編輯 | 張雨忻

“長鏈任務如果只通過代碼層面的反饋,誤差可能會不斷累積,最終效果會非常差。”談及原生多模態的意義,一位多模態研究員表示,“視覺是一種更準確的反饋,也更貼近用戶意圖。”

過去一年,Coding與Agent能力不斷改寫大模型的排名,也成為AI最快兌現商業價值的場景之一。與此同時,隨著Agent開始接管更多長鏈任務,越來越多的通用大模型開始匹配原生多模態能力。今年1月,OpenAI發佈的一份企業使用報告顯示,在研發崗位最常使用的三類ChatGPT工具中,圖片上傳排在搜索和數據分析之後,位列第三。隨著Agent開始生成網頁、操作軟件並檢查運行結果,視覺的作用正在逐步進化:它不再只是用戶交給模型的一張圖片,也開始成為模型檢查工作、發現錯誤和調整行動的反饋。剛剛過去的7月,月之暗面發佈Kimi K3。這款總參數2.

8萬億、支持100萬token上下文的MoE(混合專家模型),在Coding和長程Agent能力之外,出色的原生多模態能力是K3的另一個標籤。所謂原生多模態,是讓圖像、文字等數據從預訓練或持續預訓練階段就共同塑造主模型,並在後訓練中繼續優化,最終參與Agent(智能體)的感知與決策。K3發佈後曾以1679分登頂Arena Frontend Code榜單。該榜單由用戶盲選模型生成的可交互網頁進行排名,評判的不只是代碼能否運行,也包括頁面的最終效果。瀏覽器開發平臺Puter曾在測試網頁中製造5處視覺偏差,K3對照目標頁與運行頁截圖,全部找出且沒有誤報。

得益於出色的原生多模態能力,K3能夠看懂代碼運行後的視覺問題,為下一輪修改提供依據。Kimi方面將這種在代碼與截圖之間反覆迭代的方式稱為“vision in the loop”:模型寫完代碼後查看頁面,再根據視覺結果繼續調整。這些都離不開模型的多模態能力。除了月之暗面,阿里和字節也沿著原生多模態路線,將視覺作為通用模型的基礎能力,在最新的Qwen3.8-Max和Doubao-Seed-2.1上,可以看到視覺理解和多模態輸入都作為主要功能出現。而在國產模型頭部梯隊的另一邊,DeepSeek、智譜和騰訊混元的最新通用基座則仍以文本輸入為主。

此前,DeepSeek創始人梁文鋒曾說:“把AI訓練做好,並不需要世界模型,甚至不用多模態。”但他同時表示:“多模態最終還是要做的。”

這兩句話並不矛盾。各家公司對多模態的長期價值沒有太大分歧,真正的分歧在於時機和代價。 在Coding快速迭代的階段,要不要同步訓練視覺,以及為此投入多少模型容量、數據和算力,正在影響國產頭部模型的技術路線。 **Agent為什麼需要眼睛**

做原生多模態,到底有沒有必要?隨著當下Agent的任務鏈越來越長,這個問題開始變得愈發具體。 “很多時候我就喜歡截圖輸入。”一位來自某頭部基模團隊的研究員表示,“可能文本也能做到同樣的需求,但是你得花很多上下文去描述視覺關係。”

視覺輸入能夠帶來更多便利,但不同用戶對它的感知並不相同。“一般人可能感覺不到,但對於開發者群體而言,有多模態還是很方便。”

不過,這種需求並不只屬於開發者。上述研究員提到,他身邊一些並非AI從業者的用戶,使用模型最多的場景之一就是製作PPT。“更專業的人可能需要更多能力、更多模態,但普通用戶也會在具體場景裡用到它。”

純文本模型本身仍然“看不見”。實際系統可以調用OCR或獨立VLM(視覺語言模型),先把圖片轉換成文字、標籤、座標或結構化字段,再交給文本模型推理。這些工具可以通過Agent框架或MCP接入,用“外掛”的形式獲得視覺能力。從這個角度來看,“如何讓Agent獲得視覺輸入能力”這個命題,不僅是一個基模研發問題,也是一道產品題。如果系統調得足夠好,上游一個大的語言模型做中樞,下游放一個小一些的視覺模型,就像老闆把一件小事分配給員工,足以解決大量普通任務。但在多模態研究員看來,這種模塊化方案仍有邊界。“如果調用一個工具,總歸還是兩個模型:一個LLM是‘瞎子’,下游配一個能看清楚的小弟。

”他解釋道,原生多模態模型內部的視覺輸入與語言主幹之間“通信的通道會更寬”,而不是先把畫面壓縮成文字,再交給另一個模型判斷。這種差異也會延伸到後訓練。“如果模型自己能做,肯定是更好的事情。”陳嶼說,原生多模態模型可以在視覺強化學習中重新讀取自己生成的頁面或圖像,把視覺結果納入同一條訓練軌跡;如果依賴外部工具,感知結果還要在兩個模型之間傳遞。而在需要反覆查看屏幕的長鏈任務中,這種差別會更明顯。外接視覺工具要先把畫面轉成文字,再交給主模型判斷;原生多模態模型可以直接看懂頁面變化,接著直接決定下一步怎麼做。在交流中,一位研究員向智能湧現回憶起第一次讓GPT-5.

6 Sol操作PC端Agent時,那種“震撼”的感受。GPT-5.6 Sol不僅能自動打開瀏覽器,還能處理認證與權限,將本地代碼推上平臺,甚至直接登錄訓練平臺並啟動任務。威利森評價,模型“知道很多訣竅”,為了完成目標,幾乎會把能用的辦法都用上。“如果沒有原生多模態,模型就沒有眼睛,反饋也只侷限於文本。”上述多模態研究員說,“但很多面向用戶的輸出都是視覺的,比如網頁、圖片和視頻,模型需要理解這些結果,再給自己反饋。”

事實上,對於視覺究竟只是模型完成任務的一種工具,還是理解世界不可缺少的部分,一直以來業內並沒有達成共識。OpenAI聯合創始人、前首席科學家伊利亞·蘇茨克維(Ilya Sutskever)曾把文本稱為“世界的一種投射”:人類已經把大量現實規律壓縮進語言,模型持續學習文本,仍可能獲得對世界的理解。圖靈獎得主、Meta首席人工智能科學家楊立昆(Yann LeCun)的判斷幾乎相反:“絕大多數人類知識,並沒有以文本形式表達出來。”語言只是經過人類篩選和概括的信息;模型要理解物體、空間和行動,最終仍要從圖像、視頻和現實交互中學習。文本是高度概括過的信息,圖像和視頻更像原始信號。

原始信號包含文字沒有記錄的世界,也需要更多數據、算力和耐心,才能被提煉成可以泛化的知識。“多模態肯定不是決定性的,但它很重要。”一位模型研究員說,“基礎的圖片、視頻答題已經做得比較飽和了。下一步應該把多模態放進貼近生產的實際場景和複雜任務中。”

另一方面,隨著Agent生態在大眾用戶間全面普及,用戶對旗艦模型的期待也在變化。 6月底,智譜首席科學家唐傑在X平臺向用戶徵集“下一版GLM必須加入哪些新功能”,評論區反覆出現的答案就是“視覺”。 此前,曾有多位業內人士向智能湧現表示,智譜與騰訊混元的下一代通用基座模型,都可能進一步向原生多模態邁進。 趨勢已經出現,但是否要全面強化原生多模態路線,基模團隊們還面臨著一個資源分配的問題。 **模型長出眼睛的代價**

“對於LLM(大語言模型)來說,多模態更像是一個掛件。”一位來自某頭部基模廠商的研究員說,“模型發展的核心不是多模態,而是完成任務的能力。”

從完成任務的角度看,模型看得更多,不等於幹活能力一定更強。一個更現實的問題是:LLM加入多模態能力後,甚至有可能削弱原有的語言、推理和Coding能力。 “任務越多,越難平衡。”一位多模態研究員表示,“只做一個任務,可以一直往一個方向調;同時做兩個任務(視覺+文本),要麼模型更大一點,要麼數據更多一點。”

給模型接入視覺,並非簡單增加一個輸入接口。圖像與文字的數據結構、信息密度和學習速度不同。當它們共同訓練同一套主幹參數時,視覺數據會與文本、代碼、數學和推理爭奪模型容量,不同訓練目標也可能相互干擾。 Kimi K2.5技術報告在一項融合時機的消融實驗中記錄了這種影響:如果在訓練中後期才加入視覺數據,模型的文本能力會先下降,再逐漸恢復。 “如果想做統一原生多模態模型,付出的資源肯定是1+1大於2。”上述研究員表示,“不是把兩個單獨模型的訓練量和參數加起來,就能得到一樣的效果。”

除了訓練難之外,原生多模態在拓寬使用場景的同時,也意味著更多算力消耗。蘋果公司的MM1(多模態大模型)技術報告發現,視覺編碼器、圖像分辨率和視覺token數量都會影響模型效果;更高的分辨率和更多視覺token,通常也帶來更高的訓練與推理開銷。對於只需讀取幾個字段的任務,讓通用模型反覆查看整張圖片,未必比OCR(光學字符識別)或專業模型來得划算。K3就是眼下最直觀的樣本。這款同時追求視覺、Coding和Agent能力的“水桶模型”,總參數達到2.8萬億,每個token激活約1040億參數。從訓練方式看,K3延續了類似K2.5的early fusion(早期融合)路線。K2.

5的實驗顯示,在圖文token總量固定時,較早、以較低比例引入視覺,通常優於訓練後期再接入。其最終方案在約15萬億混合圖文token的聯合預訓練中,始終按固定比例混合文本與視覺數據。K3還從零訓練了約4億參數的視覺編碼器MoonViT-V2,不再依賴SigLIP(圖文對比預訓練模型)的初始化權重,並讓視覺表示直接進入下一token預測目標。技術報告稱,這一做法在保持視覺效果的同時提高了訓練穩定性。“多模態數據每多一點,文本理解、Coding或者數學可能就會變差,後面還得繼續調比例。考驗的是基模團隊合版的能力。”一位研究員這樣總結道。在K3發佈幾周後,DeepSeek拿出了另一種答案。

DeepSeek V4-Flash正式版總參數2840億、每個token激活130億,分別約為K3的十分之一和八分之一。它沒有調整架構和參數規模,而是把更新集中在後訓練。在DeepSeek公佈的多項Coding和Agent評測中,正式版大幅超過預覽版,甚至超過此前的V4-Pro預覽版。在考察網頁開發與多輪工具操作的Arena WebDev榜單上,它的公開得分也一度升至1577分,接近GLM-5.2,前面只剩K3、Claude Fable 5和GPT-5.6 Sol等少數模型。

DeepSeek V4-Flash證明,在不加入視覺、也不大幅擴張參數規模的情況下,後訓練仍能顯著提升Coding等核心任務能力。當這條路線還在快速產生回報時,基模公司應該把多少資源提前留給視覺,似乎還沒有統一答案。與此同時,阿里方面剛剛發佈的Qwen3.8-Max,又選擇了與K3相近的“大而全”方向:總參數2.4萬億、每個token激活950億,同時承載原生視覺、Coding和Cowork能力。不難看出,基模廠商的技術路線選擇,不完全由技術結論決定。對此,業內人士表示:“每家公司選擇多大的模型、選擇什麼賣點,最後可能都是那幾個人,或者說是老闆說了算。”

核心成員的研究背景、產品場景和訓練成本,都會影響一家公司的優先級。人才市場也在感知行業內發生的變化。智能湧現瞭解到,K3發佈後,月之暗面公司附近的咖啡館和餐廳裡,多了一些獵頭的身影,“多模態”成為了他們前來拜訪的關鍵詞。但這不意味著所有公司都會立即跟進超大參數+原生多模態的路線,更不意味著多模態會取代Coding成為競爭中心。多位業內人士認為,Coding才是上牌桌的門檻,如果Coding衝不上去,可能就沒有未來的機會。對於一眾國產基模廠商而言,這並非源於對AGI長期路線的分歧,更像是對發展時機和代價的不同考量。至少在眼下,排名、產品與商業化的壓力,仍更多落在Coding和Agent能力上。

這場競爭像是同時撥動了兩個時鐘:Coding與Agent的排名幾個月甚至幾周就會變化,而模型從語言走向世界卻需要更漫長的進化週期。前一個時鐘決定誰能跟上眼下的速度,後一個時鐘,或許決定這些公司最終能夠抵達哪裡。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前