剛剛,DeepSeek V4 系列更新,架構沒變,Agent 能力為何大漲
重點摘要
DeepSeek 推出 V4-Flash 正式版並在 API 端公測,此版本與先前 Preview 版採用相同模型架構與參數規模,僅重新進行後訓練。官方宣稱在 Terminal Bench 等 Agent 基準測試中成績明顯提升,同時原生支援 Responses API 並針對 Codex 進行適配。不過具體後訓練方法及部分測試工具尚未公開,實際表現仍待第三方獨立驗證。
DeepSeek 於稍早前低調更新了旗下模型陣容,正式推出 DeepSeek-V4-Flash 的「正式版」。不過,這波更新目前僅限於 API 端公測,主要針對 deepseek-v4-flash 這個型號,而外界更熟悉的 V4-Pro API,以及 App 與網頁端目前正在使用的模型,全都沒有跟著改動,顯示這次釋出更像是一次鎖定特定場景的定向升級。比起「正式版」這個名稱,這次更新中最引人注目的,其實是官方在說明中揭露的一個關鍵資訊:DeepSeek-V4-Flash-0731 與先前的 Preview 版本採用了完全相同的模型結構與參數規模,唯一的差別,在於模型重新進行了後訓練。
這意味著 DeepSeek 這次沒有從零開始打造新模型,而是在既有基礎上,試圖透過訓練流程的調整來進一步挖掘潛力。要理解這次更新的意義,得先回頭看大模型訓練的兩大階段。第一階段是預訓練,模型在這一階段透過海量文本與程式碼學習知識,建立基本能力,這個過程大致決定了模型「有多聰明」以及「知道多少事」。第二階段則是後訓練,這個環節更像是針對特定工作進行專項集訓,讓模型學會如何回答問題、如何正確呼叫工具,以及如何按照指令完成複雜任務。DeepSeek 這次的做法,就是沒有更動模型的原始架構,也沒有擴大參數規模,而是在原有的模型基礎上重新跑了一遍後訓練。
模型的骨架沒變,但內部的權重與行為模式已經產生變化。打個比方,這就像同一輛車沒有更換引擎,卻重新調校了變速箱、控制系統與駕駛策略;車子本身的極限沒變,但在特定路況下的實際表現,卻可能出現明顯進步。不過,關於這次後訓練的細節,DeepSeek 並沒有透露太多。官方並未公布具體使用了哪些訓練數據、採用了什麼獎勵方法,或是完整的訓練流程為何。因此,現階段外界只能確認它確實重新做了後訓練,至於性能提升究竟是來自哪一項技術的改良,暫時還無法進一步斷言。從 DeepSeek 公布的結果來看,新版 V4-Flash 的進步確實集中在 Agent 能力上。在 Terminal Bench 2.
1 測試中,V4-Flash 拿下了 82.7 分,在 DeepSWE 上獲得 54.4 分,在 DSBench-FullStack 上則拿下 68.7 分。這些測試與傳統的程式碼補全任務有本質上的不同。傳統的程式碼測試,通常只要求模型依據提示寫出一段程式碼;但 Agent 類型的測試,則要求模型真正進入一個模擬的工作環境。模型必須自己讀取檔案、理解整個程式碼倉庫的結構、呼叫終端指令、修改程式、執行測試,並根據出現的錯誤訊息持續除錯與處理。換句話說,模型不能只是「知道答案」,還必須具備連續完成多個步驟的執行能力,這對模型的規劃與工具使用能力是很大的考驗。
值得注意的是,這幾項成績並不能完全視為模型單打獨鬥的結果。DeepSeek 在說明中明確指出,部分程式碼 Agent 測試使用了尚未對外公開的 DeepSeek Harness,並且採用了較高的推理檔位;另外,DSBench-FullStack 與 DSBench-Hard 也是 DeepSeek 自家的內部測試集。因此,更精確的解讀是:V4-Flash-0731 在 DeepSeek 公布的 Agent 運行環境中取得了明顯提升,但它在第三方框架或外部測試環境中的實際表現,還需要更多獨立驗證。
除了模型權重的更新,這次釋出還有一個重要的周邊變革,就是 V4-Flash 開始原生支援 Responses API,並針對 Codex 進行了適配。Responses API 可以理解為一套更適合 Agent 運作的通訊介面,它能更一致地處理模型回覆、推理狀態、工具呼叫與執行結果等資訊。這個介面本身不會讓模型突然變得更聰明,但它的價值在於大幅減少模型接入 Codex 等 Agent 工具時所需的適配工作,讓開發者能更容易地將模型整合進真實的軟體開發流程中。所以,這次更新其實包含了兩個層面的內容:一是重新後訓練後的模型權重,二是更適合 Agent 使用的介面與運行環境。
最終呈現出來的成績,是由模型本身、推理預算、工具環境與 Agent 框架共同決定的,很難將功勞單獨歸給其中任何一項。綜合來看,目前可以確定的是,DeepSeek 在完全沒有改變 V4-Flash 模型結構與參數規模的前提下,透過重新後訓練拉高了官方 Agent 基準測試的成績,同時強化了對 Responses API 與 Codex 工作流的支援。但現階段若要因此推論「後訓練已經可以取代模型擴容」,甚至宣稱「V4-Flash 已全面領先其他 Agent 模型」,恐怕還嫌太早。
一方面,V4-Flash-0731 具體的後訓練調整細節並未公開;另一方面,官方部分測試所使用的 Harness 工具與內部數據集,也還不具備完整的外部復現條件。因此,這次更新並不適合簡單歸結為「DeepSeek 又發布了一個更強的模型」。更準確的理解或許是:DeepSeek 正在驗證一條更務實的技術路線,也就是當模型結構與參數規模維持不變時,能否透過重新後訓練、工具介面適配與 Agent 運行框架的優化,來進一步提升模型解決真實任務的能力。官方已經交出了成績單,但這條路線究竟能帶來多大的實際效益,還需要等待更多訓練細節揭露,以及第三方獨立測試的檢驗。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。