Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差

重點摘要
# Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差 Coding之外,關於原生多模態的爭論從未停止 文 | 李炤鋒 編輯 | 張雨忻 “長鏈任務如果只通過代碼層面的反饋,誤差可能會不斷累積,最終效果會非常差。”談及原生多模態的意義,一位多模態研究員表示,“視覺是一種更準確的反饋,也更貼近用戶意圖。” 過去一年,Coding與Agent能力不斷改寫大模型的排名,也成為AI最快兌現商業價值的場景之一。與此同時,隨著Agent開始接管更多長鏈任務,越來越多的通用大模型開始匹配原生多模態能力。
# Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差
Coding之外,關於原生多模態的爭論從未停止
文 | 李炤鋒 編輯 | 張雨忻
“長鏈任務如果只通過代碼層面的反饋,誤差可能會不斷累積,最終效果會非常差。”談及原生多模態的意義,一位多模態研究員表示,“視覺是一種更準確的反饋,也更貼近用戶意圖。”
過去一年,Coding與Agent能力不斷改寫大模型的排名,也成為AI最快兌現商業價值的場景之一。與此同時,隨著Agent開始接管更多長鏈任務,越來越多的通用大模型開始匹配原生多模態能力。 今年1月,OpenAI發佈的一份企業使用報告顯示,在研發崗位最常使用的三類ChatGPT工具中,圖片上傳排在搜索和數據分析之後,位列第三。 隨著Agent開始生成網頁、操作軟件並檢查運行結果,視覺的作用正在逐步進化:它不再只是用戶交給模型的一張圖片,也開始成為模型檢查工作、發現錯誤和調整行動的反饋。 剛剛過去的7月,月之暗面發佈Kimi K3。這款總參數2.8萬億、支持100萬token上下文的MoE(混合專家模型),在Coding和長程Agent能力之外,出色的原生多模態能力是K3的另一個標籤。 所謂原生多模態,是讓圖像、文字等數據從預訓練或持續預訓練階段就共同塑造主模型,並在後訓練中繼續優化,最終參與Agent(智能體)的感知與決策。 K3發佈後曾以1679分登頂Arena Frontend Code榜單。該榜單由用戶盲選模型生成的可交互網頁進行排名,評判的不只是代碼能否運行,也包括頁面的最終效果。 瀏覽器開發平臺Puter曾在測試網頁中製造5處視覺偏差,K3對照目標頁與運行頁截圖,全部找出且沒有誤報。得益於出色的原生多模態能力,K3能夠看懂代碼運行後的視覺問題,為下一輪修改提供依據。Kimi方面將這種在代碼與截圖之間反覆迭代的方式稱為“vision in the loop”:模型寫完代碼後查看頁面,再根據視覺結果繼續調整。 這些都離不開模型的多模態能力。 除了月之暗面,阿里和字節也沿著原生多模態路線,將視覺作為通用模型的基礎能力,在最新的Qwen3.8-Max和Doubao-Seed-2.1上,可以看到視覺理解和多模態輸入都作為主要功能出現。 而在國產模型頭部梯隊的另一邊,DeepSeek、智譜和騰訊混元的最新通用基座則仍以文本輸入為主。 此前,DeepSeek創始人梁文鋒曾說:“把AI訓練做好,並不需要世界模型,甚至不用多模態。”但他同時表示:“多模態最終還是要做的。”
這兩句話並不矛盾。各家公司對多模態的長期價值沒有太大分歧,真正的分歧在於時機和代價。 在Coding快速迭代的階段,要不要同步訓練視覺,以及為此投入多少模型容量、數據和算力,正在影響國產頭部模型的技術路線。 **Agent為什麼需要眼睛**
做原生多模態,到底有沒有必要?隨著當下Agent的任務鏈越來越長,這個問題開始變得愈發具體。 “很多時候我就喜歡截圖輸入。”一位來自某頭部基模團隊的研究員表示,“可能文本也能做到同樣的需求,但是你得花很多上下文去描述視覺關係。”
視覺輸入能夠帶來更多便利,但不同用戶對它的感知並不相同。“一般人可能感覺不到,但對於開發者群體而言,有多模態還是很方便。”
不過,這種需求並不只屬於開發者。上述研究員提到,他身邊一些並非AI從業者的用戶,使用模型最多的場景之一就是製作PPT。“更專業的人可能需要更多能力、更多模態,但普通用戶也會在具體場景裡用到它。”
純文本模型本身仍然“看不見”。實際系統可以調用OCR或獨立VLM(視覺語言模型),先把圖片轉換成文字、標籤、座標或結構化字段,再交給文本模型推理。這些工具可以通過Agent框架或MCP接入,用“外掛”的形式獲得視覺能力。 從這個角度來看,“如何讓Agent獲得視覺輸入能力”這個命題,不僅是一個基模研發問題,也是一道產品題。 如果系統調得足夠好,上游一個大的語言模型做中樞,下游放一個小一些的視覺模型,就像老闆把一件小事分配給員工,足以解決大量普通任務。 但在多模態研究員看來,這種模塊化方案仍有邊界。“如果調用一個工具,總歸還是兩個模型:一個LLM是‘瞎子’,下游配一個能看清楚的小弟。”他解釋道,原生多模態模型內部的視覺輸入與語言主幹之間“通信的通道會更寬”,而不是先把畫面壓縮成文字,再交給另一個模型判斷。 這種差異也會延伸到後訓練。“如果模型自己能做,肯定是更好的事情。”陳嶼說,原生多模態模型可以在視覺強化學習中重新讀取自己生成的頁面或圖像,把視覺結果納入同一條訓練軌跡;如果依賴外部工具,感知結果還要在兩個模型之間傳遞。 而在需要反覆查看屏幕的長鏈任務中,這種差別會更明顯。外接視覺工具要先把畫面轉成文字,再交給主模型判斷;原生多模態模型可以直接看懂頁面變化,接著直接決定下一步怎麼做。 在交流中,一位研究員向智能湧現回憶起第一次讓GPT-5.6 Sol操作PC端Agent時,那種“震撼”的感受。GPT-5.6 Sol不僅能自動打開瀏覽器,還能處理認證與權限,將本地代碼推上平臺,甚至直接登錄訓練平臺並啟動任務。 威利森評價,模型“知道很多訣竅”,為了完成目標,幾乎會把能用的辦法都用上。 “如果沒有原生多模態,模型就沒有眼睛,反饋也只侷限於文本。”上述多模態研究員說,“但很多面向用戶的輸出都是視覺的,比如網頁、圖片和視頻,模型需要理解這些結果,再給自己反饋。”
事實上,對於視覺究竟只是模型完成任務的一種工具,還是理解世界不可缺少的部分,一直以來業內並沒有達成共識。 OpenAI聯合創始人、前首席科學家伊利亞·蘇茨克維(Ilya Sutskever)曾把文本稱為“世界的一種投射”:人類已經把大量現實規律壓縮進語言,模型持續學習文本,仍可能獲得對世界的理解。 圖靈獎得主、Meta首席人工智能科學家楊立昆(Yann LeCun)的判斷幾乎相反:“絕大多數人類知識,並沒有以文本形式表達出來。”語言只是經過人類篩選和概括的信息;模型要理解物體、空間和行動,最終仍要從圖像、視頻和現實交互中學習。 文本是高度概括過的信息,圖像和視頻更像原始信號。原始信號包含文字沒有記錄的世界,也需要更多數據、算力和耐心,才能被提煉成可以泛化的知識。 “多模態肯定不是決定性的,但它很重要。”一位模型研究員說,“基礎的圖片、視頻答題已經做得比較飽和了。下一步應該把多模態放進貼近生產的實際場景和複雜任務中。”
另一方面,隨著Agent生態在大眾用戶間全面普及,用戶對旗艦模型的期待也在變化。 6月底,智譜首席科學家唐傑在X平臺向用戶徵集“下一版GLM必須加入哪些新功能”,評論區反覆出現的答案就是“視覺”。 此前,曾有多位業內人士向智能湧現表示,智譜與騰訊混元的下一代通用基座模型,都可能進一步向原生多模態邁進。 趨勢已經出現,但是否要全面強化原生多模態路線,基模團隊們還面臨著一個資源分配的問題。 **模型長出眼睛的代價**
“對於LLM(大語言模型)來說,多模態更像是一個掛件。”一位來自某頭部基模廠商的研究員說,“模型發展的核心不是多模態,而是完成任務的能力。”
從完成任務的角度看,模型看得更多,不等於幹活能力一定更強。一個更現實的問題是:LLM加入多模態能力後,甚至有可能削弱原有的語言、推理和Coding能力。 “任務越多,越難平衡。”一位多模態研究員表示,“只做一個任務,可以一直往一個方向調;同時做兩個任務(視覺+文本),要麼模型更大一點,要麼數據更多一點。”
給模型接入視覺,並非簡單增加一個輸入接口。圖像與文字的數據結構、信息密度和學習速度不同。當它們共同訓練同一套主幹參數時,視覺數據會與文本、代碼、數學和推理爭奪模型容量,不同訓練目標也可能相互干擾。 Kimi K2.5技術報告在一項融合時機的消融實驗中記錄了這種影響:如果在訓練中後期才加入視覺數據,模型的文本能力會先下降,再逐漸恢復。 “如果想做統一原生多模態模型,付出的資源肯定是1+1大於2。”上述研究員表示,“不是把兩個單獨模型的訓練量和參數加起來,就能得到一樣的效果。”
除了訓練難之外,原生多模態在拓寬使用場景的同時,也意味著更多算力消耗。 蘋果公司的MM1(多模態大模型)技術報告發現,視覺編碼器、圖像分辨率和視覺token數量都會影響模型效果;更高的分辨率和更多視覺token,通常也帶來更高的訓練與推理開銷。 對於只需讀取幾個字段的任務,讓通用模型反覆查看整張圖片,未必比OCR(光學字符識別)或專業模型來得划算。 K3就是眼下最直觀的樣本。這款同時追求視覺、Coding和Agent能力的“水桶模型”,總參數達到2.8萬億,每個token激活約1040億參數。 從訓練方式看,K3延續了類似K2.5的early fusion(早期融合)路線。K2.5的實驗顯示,在圖文token總量固定時,較早、以較低比例引入視覺,通常優於訓練後期再接入。其最終方案在約15萬億混合圖文token的聯合預訓練中,始終按固定比例混合文本與視覺數據。 K3還從零訓練了約4億參數的視覺編碼器MoonViT-V2,不再依賴SigLIP(圖文對比預訓練模型)的初始化權重,並讓視覺表示直接進入下一token預測目標。技術報告稱,這一做法在保持視覺效果的同時提高了訓練穩定性。 “多模態數據每多一點,文本理解、Coding或者數學可能就會變差,後面還得繼續調比例。考驗的是基模團隊合版的能力。”一位研究員這樣總結道。 在K3發佈幾周後,DeepSeek拿出了另一種答案。DeepSeek V4-Flash正式版總參數2840億、每個token激活130億,分別約為K3的十分之一和八分之一。它沒有調整架構和參數規模,而是把更新集中在後訓練。 在DeepSeek公佈的多項Coding和Agent評測中,正式版大幅超過預覽版,甚至超過此前的V4-Pro預覽版。在考察網頁開發與多輪工具操作的Arena WebDev榜單上,它的公開得分也一度升至1577分,接近GLM-5.2,前面只剩K3、Claude Fable 5和GPT-5.6 Sol等少數模型。 DeepSeek V4-Flash證明,在不加入視覺、也不大幅擴張參數規模的情況下,後訓練仍能顯著提升Coding等核心任務能力。 當這條路線還在快速產生回報時,基模公司應該把多少資源提前留給視覺,似乎還沒有統一答案。 與此同時,阿里方面剛剛發佈的Qwen3.8-Max,又選擇了與K3相近的“大而全”方向:總參數2.4萬億、每個token激活950億,同時承載原生視覺、Coding和Cowork能力。 不難看出,基模廠商的技術路線選擇,不完全由技術結論決定。對此,業內人士表示:“每家公司選擇多大的模型、選擇什麼賣點,最後可能都是那幾個人,或者說是老闆說了算。”
核心成員的研究背景、產品場景和訓練成本,都會影響一家公司的優先級。 人才市場也在感知行業內發生的變化。智能湧現瞭解到,K3發佈後,月之暗面公司附近的咖啡館和餐廳裡,多了一些獵頭的身影,“多模態”成為了他們前來拜訪的關鍵詞。 但這不意味著所有公司都會立即跟進超大參數+原生多模態的路線,更不意味著多模態會取代Coding成為競爭中心。 多位業內人士認為,Coding才是上牌桌的門檻,如果Coding衝不上去,可能就沒有未來的機會。 對於一眾國產基模廠商而言,這並非源於對AGI長期路線的分歧,更像是對發展時機和代價的不同考量。至少在眼下,排名、產品與商業化的壓力,仍更多落在Coding和Agent能力上。 這場競爭像是同時撥動了兩個時鐘:Coding與Agent的排名幾個月甚至幾周就會變化,而模型從語言走向世界卻需要更漫長的進化週期。 前一個時鐘決定誰能跟上眼下的速度,後一個時鐘,或許決定這些公司最終能夠抵達哪裡。
Related
相關文章

千萬別隨便跟 AI 掏心窩子,斯坦福研究揭露了一個扎心真相
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

“連賣AI的微軟也扛不住了”……一人每月燒掉數千美元Token,工程師被提醒別「狂刷Token」,並開始對AI消耗“限額”
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

國產頂流開源模型狂飆背後的“安全裸奔”:漏洞復現達76%、高危指令零拒答
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦安徽最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作國產頂流開源模型狂飆背後的“安全裸奔”:漏洞復現達76%、高危指令零拒答AI前線·2026年08月05日 16:41儘管開源模型的能力逼近閉源,但安全治理卻明顯滯後且被忽視 隨著智譜 GLM、Kimi 等一系列國產模型加快追趕與開源步伐,開放權重模型 vs 閉源前沿模型 之間的能力鴻溝,正在從“代際差距”迅速縮短至以“月”為單位的微弱領先,這自然是喜人的發展態勢。 但當開源的網絡攻擊、生物研究甚至自主 Agent能力逼近行業前沿時,一個棘手的問題被推到臺前:模型的能力可以被完整開源和釋放,但安全邊界卻未必能隨權重文件一起保留下來。 近日,歐洲 AI 安全非營利機構 SaferAI 發佈了一份針對智譜 GLM-5.2 的獨立風險評估報告。測試團隊在未通知智譜、也未獲得其配合的情況下,通過公開 API 以普通開發者身份進行測試,並將其與 Claude Opus 4.7、GPT-5.5 等前沿閉源模型進行橫向對比。 測試覆蓋了歐盟《通用人工智能行為準則》定義的四類系統性風險:網絡攻擊、CBRN(化學、生物、放射、核)風險、失控風險及有害操縱。 結論頗具衝擊力:GLM-5.2 在網絡攻擊和生物研究能力上僅落後 GPT-5.

Google AI把「地球」玩壞了,這是對10億人的不負責
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

失控的硅谷AI越獄連續劇
失控的硅谷AI越獄連續劇腦極體2026.08.05 16:35 · 來自天津全文5417字00:00 / 15:36十天兩起攻擊,頂級模型為何集體叛逃?文 | 腦極體近幾天,AI圈發生了一件大事:常年瘋狂內卷、比拼技術迭代速度、爭相搶佔市場高地的硅谷AI巨頭們突然集體轉身,公開喊話要求給AI發展“踩下剎車”。7月31日,一封名為“Pacing the Frontier”的聯名請願被投放到各大媒體的郵箱。

中國大模型周調用量全球登頂,Kimi K3引爆價格戰
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。