剛剛,DeepSeek新模型上線,長文本緩存硬盤佔用暴降88%!

2026年9月10日 08:07
站內 AI 整理稿

作者|畢偉豪 編輯|李水青 9月10日報道,剛剛,DeepSeek正式發佈DeepSeek V4.1 Flash,該模型採用全新架構,是一款552B參數的MoE模型,為DeepSeek全新模型架構系列中尺寸最小的成員,在性能上超越了包括DeepSeek V4 Pro在內的一眾旗艦模型。模型開源地址: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 論文鏈接: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeekV41Tech_Report.

pdf 同時,DeepSeek App顯示已完成全新升級,整合了快速、專家和識圖模式,並上線了新模型,網頁端應該也已同步上新。一、性能全面超越旗艦,定價下調 價格方面,得益於模型架構的創新,與DeepSeek V4 Flash相比,DeepSeek下調了V4.1 Flash的定價,峰谷定價機制被保留,閒時價格為高峰時段價格的一半,官方鼓勵用戶根據實際使用情況調整任務時間。全新定價為閒時輸入(緩存命中)0.02元、未命中1.0元、輸出4.0元,高峰時段輸入(緩存命中)0.04元,未命中2.0元,輸出8.0元,新價格已於2026年9月10日12:00正式生效。▲DeepSeek V4.

1 Flash定價表(圖源:DeepSeek) 該模型具備原生多模態視覺理解能力,採用了全新的Causal-Encoder-Decoder架構,輸入和輸出不對稱,輸入激活參數只有8B,輸出激活為16B,成本顯著低於已知的同尺寸模型。▲DeepSeek-V4.1-Flash與主流前沿模型在Agentic Benchmark上的性能對比(圖源:DeepSeek) 同時,在新的預訓練方式和更大規模強化學習後訓練的加持下,這款更小尺寸的模型在Agentic Benchmark等基準測試中超越了DeepSeek V4 Pro、GLM5.3、Kimi-K3等多款前沿旗艦模型。▲DeepSeek-V4.

1-Flash與主流前沿模型在Agentic Benchmark上的性能對比(圖源:DeepSeek) 官方在公告中給出了新模型架構的設計初衷:能力上限更高、推理速度更快、吞吐更大,並且可以擴展到更大參數規模的模型。二、緩存大幅壓縮,DeepSeek V4 Pro即將退場 新一代模型在KV Cache緩存效率方面有了大幅提升,與DeepSeek V4 Flash相比,V4.1 Flash對HBM的需求減少到1/4,對SSD的需求減少到1/8。DeepSeek官方稱,初代模型DeepSeek V1的KV Cache是DeepSeek V4.1 Flash的437倍。

▲DeepSeek在減少上下文存儲方面的持續進展(圖源:DeepSeek) 這一次壓縮由架構、緩存精度和部署策略三方協同完成。架構上,新模型採用CSA2(壓縮稀疏注意力2)機制,將全局KV緩存和Top-K索引跨層複用,每一層只保留自己的查詢向量和局部注意力緩存,重複存儲被大幅砍掉。緩存精度方面,模型從訓練階段就直接用FP4格式存儲全局KV緩存,官方稱性能損失幾乎可以忽略。部署一側,新增SWA有界重放機制,只需重放最近的n個token,就能近似重建滑動窗口注意力(SWA)所需的狀態,SWA緩存因此不必再寫入SSD,持久化緩存的佔用進一步壓到V4 Flash的1/8。

這些設計疊加,把上下文從4K拉長到1M,單token解碼FLOPs只增加約四分之一,解碼成本幾乎不隨上下文長度增長。▲DeepSeek-V4.1-Flash上下文長度和前代模型對比(圖源:DeepSeek) 這項數字直接關係到用戶賬單,在Agent使用場景中,緩存命中的費用往往佔比較高,KV Cache的壓縮大幅降低了Agent類任務的使用成本。對需要長上下文、多輪調用的Agent工作流來說,同樣的預算能跑更多的任務。目前,DeepSeek V4.1 Flash已同步上線DeepSeek API,用戶將模型名稱改為deepseek-flash即可調用V4.

1 Flash,舊版本模型V4 Flash與V4 Flash Vision Exp現已下線,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp將被暫時路由到V4.1 Flash。昨日,DeepSeek方面宣佈,由於在多方測試中DeepSeek V4.1 Flash的各項指標全面超越DeepSeek V4 Pro,因此DeepSeek將從北京時間9月14日12:00起有序下線V4 Pro,所有deepseek-v4-pro的請求都將被路由到新模型,按V4.1 Flash單價計費。

▲DeepSeek模型調整公告(圖源:DeepSeek) 三、全力支持開源,WorkBuddy、OpenCode全量接入 除模型能力之外,DeepSeek在開源和生態方面也有一系列動作。DeepSeek今日宣佈將會全力支持開源社區進行新模型的推理適配,並嘗試通過各種方式擴大部署的範圍。如果用戶有大規模部署的需求且具備相應的資源(2k卡GPU、有存儲集群),可以與DeepSeek聯繫。剛剛,DeepSeek Harness v0.1.5版本同步上線,DeepSeek V4.1 Flash模型針對DeepSeek Harness進行了專項訓練和優化,用戶在使用DeepSeek V4.

1 Flash模型時,DeepSeek Harness新版本還支持在保留已有KV Cache的情況下更新系統提示詞。生態側,騰訊(WorkBuddy、CodeBuddy等)和OpenCode作為官方合作伙伴,現已全量接入DeepSeek V4.1 Flash,OpenCode Go套餐提供了4倍使用額度。▲OpenCode模型使用額度表(圖源:OpenCode) WorkBuddy中同樣提供限時兩週的獨家優惠,騰訊雲TokenHub、ima、Marvis、CodeBuddy同步接入DeepSeek V4.1 Flash。

而在此前路透社關於DeepSeek融資的相關報道中,騰訊正是DeepSeek投資人之一。同期開源的還有DeepJIT,一個輕量級的xPU內核JIT編譯庫,同時支持NVIDIA CUDA GPU和華為昇騰NPU兩大後端,為推理側的內核編譯提供統一接口和跨節點共享緩存能力。結語:最小模型反超旗艦,推理成本持續下降 DeepSeek V4.1 Flash這款模型,在用全新架構將成本壓低的同時,用更大規模的強化學習將智能水平拉高,以更小的尺寸在自家產品線上完成了對旗艦的全面超越。對高頻使用Agent的用戶來說,緩存壓縮和價格的降低疊加,實際賬單的變化會比基準分數體感更強。

從更長的時間線看,官方宣稱新架構可擴展到更大參數的模型,我們或可期待一下即將到來的DeepSeek全新旗艦模型。可以看到,DeepSeek的產品線正圍繞新架構重新排序。V4 Pro的有序下線只是這次更替的開始,後續更大參數的模型能把前沿模型的性價比推到什麼程度,值得期待。

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

1 小時前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

7 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前