剛剛,DeepSeek V4 系列更新,架構沒變,Agent 能力為何大漲
重點摘要
DeepSeek 推出 V4-Flash 正式版並在 API 端公測,此版本與先前 Preview 版採用相同模型架構與參數規模,僅重新進行後訓練。官方宣稱在 Terminal Bench 等 Agent 基準測試中成績明顯提升,同時原生支援 Responses API 並針對 Codex 進行適配。不過具體後訓練方法及部分測試工具尚未公開,實際表現仍待第三方獨立驗證。
DeepSeek 於稍早前低調更新了旗下模型陣容,正式推出 DeepSeek-V4-Flash 的「正式版」。不過,這波更新目前僅限於 API 端公測,主要針對 deepseek-v4-flash 這個型號,而外界更熟悉的 V4-Pro API,以及 App 與網頁端目前正在使用的模型,全都沒有跟著改動,顯示這次釋出更像是一次鎖定特定場景的定向升級。 比起「正式版」這個名稱,這次更新中最引人注目的,其實是官方在說明中揭露的一個關鍵資訊:DeepSeek-V4-Flash-0731 與先前的 Preview 版本採用了完全相同的模型結構與參數規模,唯一的差別,在於模型重新進行了後訓練。這意味著 DeepSeek 這次沒有從零開始打造新模型,而是在既有基礎上,試圖透過訓練流程的調整來進一步挖掘潛力。 要理解這次更新的意義,得先回頭看大模型訓練的兩大階段。第一階段是預訓練,模型在這一階段透過海量文本與程式碼學習知識,建立基本能力,這個過程大致決定了模型「有多聰明」以及「知道多少事」。第二階段則是後訓練,這個環節更像是針對特定工作進行專項集訓,讓模型學會如何回答問題、如何正確呼叫工具,以及如何按照指令完成複雜任務。 DeepSeek 這次的做法,就是沒有更動模型的原始架構,也沒有擴大參數規模,而是在原有的模型基礎上重新跑了一遍後訓練。模型的骨架沒變,但內部的權重與行為模式已經產生變化。打個比方,這就像同一輛車沒有更換引擎,卻重新調校了變速箱、控制系統與駕駛策略;車子本身的極限沒變,但在特定路況下的實際表現,卻可能出現明顯進步。 不過,關於這次後訓練的細節,DeepSeek 並沒有透露太多。官方並未公布具體使用了哪些訓練數據、採用了什麼獎勵方法,或是完整的訓練流程為何。因此,現階段外界只能確認它確實重新做了後訓練,至於性能提升究竟是來自哪一項技術的改良,暫時還無法進一步斷言。 從 DeepSeek 公布的結果來看,新版 V4-Flash 的進步確實集中在 Agent 能力上。在 Terminal Bench 2.1 測試中,V4-Flash 拿下了 82.7 分,在 DeepSWE 上獲得 54.4 分,在 DSBench-FullStack 上則拿下 68.7 分。這些測試與傳統的程式碼補全任務有本質上的不同。 傳統的程式碼測試,通常只要求模型依據提示寫出一段程式碼;但 Agent 類型的測試,則要求模型真正進入一個模擬的工作環境。模型必須自己讀取檔案、理解整個程式碼倉庫的結構、呼叫終端指令、修改程式、執行測試,並根據出現的錯誤訊息持續除錯與處理。換句話說,模型不能只是「知道答案」,還必須具備連續完成多個步驟的執行能力,這對模型的規劃與工具使用能力是很大的考驗。 值得注意的是,這幾項成績並不能完全視為模型單打獨鬥的結果。DeepSeek 在說明中明確指出,部分程式碼 Agent 測試使用了尚未對外公開的 DeepSeek Harness,並且採用了較高的推理檔位;另外,DSBench-FullStack 與 DSBench-Hard 也是 DeepSeek 自家的內部測試集。因此,更精確的解讀是:V4-Flash-0731 在 DeepSeek 公布的 Agent 運行環境中取得了明顯提升,但它在第三方框架或外部測試環境中的實際表現,還需要更多獨立驗證。 除了模型權重的更新,這次釋出還有一個重要的周邊變革,就是 V4-Flash 開始原生支援 Responses API,並針對 Codex 進行了適配。Responses API 可以理解為一套更適合 Agent 運作的通訊介面,它能更一致地處理模型回覆、推理狀態、工具呼叫與執行結果等資訊。這個介面本身不會讓模型突然變得更聰明,但它的價值在於大幅減少模型接入 Codex 等 Agent 工具時所需的適配工作,讓開發者能更容易地將模型整合進真實的軟體開發流程中。 所以,這次更新其實包含了兩個層面的內容:一是重新後訓練後的模型權重,二是更適合 Agent 使用的介面與運行環境。最終呈現出來的成績,是由模型本身、推理預算、工具環境與 Agent 框架共同決定的,很難將功勞單獨歸給其中任何一項。 綜合來看,目前可以確定的是,DeepSeek 在完全沒有改變 V4-Flash 模型結構與參數規模的前提下,透過重新後訓練拉高了官方 Agent 基準測試的成績,同時強化了對 Responses API 與 Codex 工作流的支援。但現階段若要因此推論「後訓練已經可以取代模型擴容」,甚至宣稱「V4-Flash 已全面領先其他 Agent 模型」,恐怕還嫌太早。 一方面,V4-Flash-0731 具體的後訓練調整細節並未公開;另一方面,官方部分測試所使用的 Harness 工具與內部數據集,也還不具備完整的外部復現條件。因此,這次更新並不適合簡單歸結為「DeepSeek 又發布了一個更強的模型」。 更準確的理解或許是:DeepSeek 正在驗證一條更務實的技術路線,也就是當模型結構與參數規模維持不變時,能否透過重新後訓練、工具介面適配與 Agent 運行框架的優化,來進一步提升模型解決真實任務的能力。官方已經交出了成績單,但這條路線究竟能帶來多大的實際效益,還需要等待更多訓練細節揭露,以及第三方獨立測試的檢驗。
Related
相關文章
AI 正在變成一門製造業 | WAIC 2026 Agent 產品觀察
國內 Agent 產品當前主要是供給側繁榮,不是需求側繁榮。 作者丨李 娜 編輯丨馬曉寧 2026 年的 WAIC 真是太熱鬧了,人潮擁擠,在地鐵站排著隊進入 WAIC 場館的時候, 我看見地鐵站廣告牌上的百度智能體“百度搭子”的廣告,這場關於智能體沒有硝煙的戰爭,從入口處就拉開了帷幕。
JetBrains Open-Sources KotlinLLM: Smart Macros That Generate Kotlin Source Code at Runtime and Hot-Reload It Through JDI
JetBrains Research 開源 KotlinLLM,這款 IntelliJ IDEA 外掛為 Kotlin/JVM 專案加入 Smart macros 語言功能,可在執行階段產生 Kotlin 原始碼並透過 JDI 熱重載。根據測試,在改寫的 Spring Petclinic 專案中 24 個情境全部成功,熱重載成功率 100%,編譯與重定義僅增加約 1% 執行開銷。此專案屬研究原型,採用 Apache License 2.0,需搭配 IntelliJ IDEA 2025.2.x、JDK 21 與 OpenAI API 金鑰。
微信公眾號推出 AI"一鍵排版":自動分段、生成小標題、匹配配圖三步到位
微信公眾號平台正式推出 AI「一鍵排版」功能,創作者在手機 App 或網頁版編輯文章時,系統會自動識別內容並彈出排版圖標,一鍵完成整套排版。功能涵蓋自動分段與調整間距、自動生成小標題樣式,以及智慧調整圖片大小與對齊,並支援多圖轉輪播。目前提供「標準」與「細體」兩種風格,讓創作者能快速完成從碼字到發布前的排版工作。
DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題
AI資訊AI新閒資訊正文DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘DeepSeek V4 正式版自 7 月中旬開啟灰度測試後一度跳票,官方至今未公佈確切發佈時間。但多個新證據指向 8 月 3 日可能成為重要節點——硅基流動率先露出馬腳。
AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線
AI資訊最新AI日報正文AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線發布於最新AI日報時間 :Jul 31, 2026閱讀 :2分鐘歡迎來到【AI日報】欄目!這裡是你每天探索人工智能世界的指南,每天我們為你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。
韓國最大 AI 模型問世:LG 發佈 7500 億參數 K-EXAONE 2.0,Apache 開源直面中國模型
LG AI研究院發布韓國最大AI基礎模型K-EXAONE 2.0,總參數達7500億,採用混合注意力MoE架構,並以Apache 2.0許可證完全開源。該模型在多項基準測試中表現優於初代,同時在長上下文理解與智能體工具使用等能力上直接對標智譜GLM-5.1、Qwen3.5等中國開源模型,顯示東亞開源AI競爭加劇。