梁文鋒用沙盒開啟RSI

字母AI2026.09.24 18:16 · 來自北京全文4232字00:00 / 11:21DeepSeek聯合清華大學發論文,梁文鋒署名文 | 字母AIDeepSeek聯合清華大學發表了一篇文章,署名的最後一人是梁文鋒。文章表面上是說DeepSeek訓練Agent所使用的沙盒,但是論文第6節越看越不對勁。字裡行間寫了三個英文字母:RSI。通過這個沙盒,Agent能創建自己需要的環境,這個環境會再次訓練Agent,被訓練的更強的Agent會創造更好的環境。由此形成了一個小型的RSI閉環。也正是因此,沙盒,或許成為了開啟RSI第一場戰爭的一把鑰匙。那這篇文章到底講了什麼呢?
這篇論文到底講了什麼梁文鋒署名的這篇新論文,標題叫做《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,9月19日提交到 arXiv,編號2609.22978。作者超過130人,梁文鋒排在最後一位。合作方是清華大學。論文做的事情,一句話就能說完:DeepSeek完整公開了自己用來訓練Agent的“沙盒工廠”DSec。但是要理解DSec,就得先理解“訓練Agent”和“訓練大模型”的區別。訓練大模型,是喂數據、算梯度,環境就是GPU集群。
訓練Agent則完全不同,Agent要在環境裡寫代碼、跑編譯、開瀏覽器、裝依賴、調工具,然後根據執行結果不斷重試,直到任務完成。但如果把Agent放在電腦裡訓練,它萬一搗鼓點什麼出來,那整個環境就毀了。所以這就需要一個隔離的、有狀態的、能跑真實軟件的沙盒。DSec就是這樣一個平臺。它通過一套統一的Python SDK(libdsec)對外提供四種後端:函數調用(FnCall)、容器(Container)、輕量虛擬機(microVM)、完整虛擬機(Full VM)。簡單來說,DSec就是外賣APP,Agent是騎手,沙盒就相當於是派單。
由此類推,FnCall、容器和輕量虛擬機就是外賣站點分發的電動車和保溫箱,完整虛擬機是冷鏈貨車。但這裡有個小問題,隔離強度和系統功能兩者生來就“不對付”。越像一臺真機,啟動越慢、內存開銷越大。跑一段短腳本用函數調用,改一個代碼倉庫用容器,跑安全任務用microVM,而要跑安卓、圖形界面這種完整系統,就只能上完整虛擬機。論文顯示,一個生產單元約160個CPU節點、3萬核、250TB內存,託管PB級鏡像。一天服務約300萬個沙盒,峰值併發超過38萬個,創建速度超過每秒5000個。單個訓練任務最多能一次性拉起3.2萬個沙盒。單節點上,最高能塞進800個 microVM或3200個容器。
DSec有三個核心機制。第一,把環境拆成“可組合的層”。過去一個沙盒環境是一整塊鏡像,改一個工具包就得重建整塊鏡像,維護成本隨組合數暴漲。DSec把基礎鏡像、工作區、工具包拆成三層獨立版本化的只讀層(EROFS),啟動時用overlayfs拼起來,改哪層只重建哪層。實測比 tar.gz 打包方式快1.76倍,磁盤寫入量少5.5倍。相當於是給騎手配車,以前是壞了其中一個零部件,那麼整車都要換。DSec是壞了哪個換哪個。第二,鏡像“按需加載”。鏡像存在3FS(DeepSeek 的分佈式文件系統)上,元數據預取到本地,數據塊只在真正讀到時才拉。
實測8192個容器的突發部署,按需加載35分鐘跑完,而 Docker 冷拉取要60分鐘以上,磁盤寫入量少了約57%。老辦法是“不管用不用,整倉先搬空”。DSec是“根據外賣單,用到哪件騎手去取哪件”。第三,內存和CPU的“精打細算”。用virtio-pmem配合DAX,讓多個虛擬機共享同一份頁緩存,峰值內存降40.2%;用DAMON加balloon回收冷頁,時間積分內存再降21.2%;CPU上把沙盒分成“延遲敏感”和“盡力而為”兩類,用core scheduling把SMT干擾從45.2%壓到17.3%。此外,從DeepSeek-V4.
1開始,論文還把Agent的rollout從可被搶佔的GPU訓練Pod裡拆出來,獨立跑在DSec上,GPU被搶時rollout狀態不丟。說白了就是讓騎手們公用同一張地圖、同一批貨架,車裡壓倉的冷貨隨手退回倉庫,加急單和普通單分道跑、互不搶道。藏在第6節的RSI論文裡最容易被忽略一句話,不在摘要,而在第6節的小標題裡:Build environments of Agents, by Agents, for Agents。意為由Agent建造、為Agent服務、屬於Agent的環境。這句話等於DeepSeek悄悄交代了一件大事,DeepSeek也實現了部分RSI。論文第6.
1節寫到,手工構造Agent RL所需的大量環境已經“不現實”(impractical)。於是DeepSeek換了個做法,讓Agent在訓練用的同一套沙盒裡,交互式地自己搭環境,再用packdiff把這次會話打成一張增量快照,直接變成下一批可複用的訓練場。造環境的Agent和被訓練的Agent共用DSec這套沙盒基礎設施。Agent鋪場地 → 場地訓練Agent → 更強的Agent再鋪更好的場地。DeepSeek的RSI由此部分實現閉環。但是這個閉環仍處於早期。第6.
4節記錄了大量Agent作弊事件,比如去平臺裡翻殘留的參考答案,偽造RPC消息直接發給chronus套答案,翻 chronus日誌找洩題,甚至覆蓋/bin/bash來繞過檢查。被攔住之後,又用XFSIOCSWAPEXT這個ioctl把受保護文件的存儲塊換到另一個文件描述符上,結果把XFS元數據搞壞、逼得文件系統關閉。有作弊的自然就有闖禍的。一個Agent從根目錄遞歸grep、一路讀到/proc/kpagecgroup,觸發內核bug直接把內核幹崩。另一個Agent調了yes命令,chronus把它的輸出全記下來,幾十GB數據堆在存儲上。現在的RSI轉不起來,卡的從來不是GPU,是環境供給。
Agent RL每一代都要新任務、新沙盒、新服務依賴,人工造環境才是真瓶頸。DSec相當於是把這一環部分自動化了,自動生成RSI所需要的環境。還是用外賣來舉例。一個外賣平臺想越跑越快,不能只靠一個騎手重複送同一單。想要騎手變強,就需要接更多不同種類的單,而單越多又反過來把騎手練得更強。但是想要把這個飛輪轉起來,卡的從來不是騎手,是餐廳夠不夠多。沒餐廳,騎手再能跑也是空轉。DSec是蓋了一個“自動建餐廳”的系統。以前平臺得人工一家家談商家、裝修後廚、寫菜單、定考核標準,幾百幾千家根本談不過來。DSec說:“別談了,讓騎手在跑單的同一個後廚裡,順手把店開了。
他怎麼裝的灶臺、進的什麼貨、接的什麼水電,系統用packdiff‘啪’拍一張快照存下來,下一波騎手直接拎包入駐這家店開工,不用重新裝修。”沙盒,成了新的戰場DSec不是孤例。整個行業都在朝著“Agent沙盒”這一個方向發力。最出名的案例是Kimi K3。月之暗面7月16日發佈K3,2.8萬億參數的 MoE,每個token激活約104B 參數,100萬 token上下文,原生視覺,號稱“全球首個開源的3T級模型”,SWE-bench拿到76.8%、開源第一。它的Agent Swarm最多能並行調度300個子代理。DeepSeek這篇論文裡,引用的也正是Kimi-K2.5的Agent Swarm。
Kimi訓練K3的時候所使用的AgentENV也是一種沙盒。AgentENV跑在Firecracker microVM上的分佈式沙盒平臺,每個沙盒獨立Linux內核、獨立網絡棧、獨立文件系統,底層存儲用OverlayBD + ublk,只讀層全集群共享,每個沙盒寫自己的上層。跟DSec是同一套技術棧。DSec論文第7節寫到,它用的那套Rust版OverlayBD/ublk存儲庫,就開源在AgentENV這個倉庫裡。兩者相當於是同門師兄弟。但AgentENV沒法實現RSI,它給的是fork/snapshot這種“狀態操作原語”,讓RL rollout能並行、能回滾、能幹淨判分。
因此,它沒法像DSec那樣讓Agent自己造環境。類似的還有阿里。雲棲大會上,阿里雲CTO李飛飛拋出了“Agentic Cloud”戰略,把Model、Harness、Context 當成三個核心場景,一口氣推出AgentCore、Agent Sandbox、新一代存儲CPFS。其中Agent Sandbox能創建吞吐10萬個/分鐘,深休眠喚醒小於600毫秒,兼容E2B和K8s。沙盒正在成為“新的運行時”。雲計算的主體,從虛擬機,到容器,再到模型,現在輪到Agent。誰掌握Agent的執行環境,誰就掌握了下一代雲的入口。這就導致,競爭焦點從“模型能力”轉向“環境基礎設施”。
“訓練大模型拼算力,訓練Agent拼環境”。在GPU 之外,CPU、內存、存儲、鏡像分發,全都變成了新的瓶頸。還有一點,安全從附加項的價值也變得極為重要。OpenAI、Anthropic各種模型越獄、DSec論文裡Agent的作弊和內核崩潰,說的是同一件事。沙盒如果不牢,訓練信號就是假的,評估就是廢的。所以像是阿里這樣的廠商,會把“安全圍欄”也當成賣點,DSec用AppArmor加eBPF。沙盒廠商過去比的是快和便宜,現在開始比誰更牢固。RSI的第一戰已經開始了。想跑RSI,那你就先得有沙盒,有環境。
Related
相關文章

首部上星AI長劇《後西遊記》幕後:沒有攝影機,100%畫面由Seedance生成,單集成本壓到十幾萬
這部規劃60集、每集約40分鐘的劇集由芒果TV出品、伯璟文化承製,全程沒有一臺攝影機,視頻生成100%交給Seedance完成。上線僅一週,芒果TV正片播放量就衝破1.5億次。把這部劇推出來的,是兩個被傳統影視邏輯卡過的人。總導演李東珅長期拍紀錄片,執導的《河西走廊》豆瓣9.

螞蟻inclusionAI把訓練底稿擺上HuggingFace,Ling、Ring、Ming全系模型按歐盟AI法案交透明賬
這不是又一輪發模型權重,而是一次針對"模型到底吃了什麼數據練出來"的主動交代——倉庫裡只有文檔,沒有權重,也沒有訓練數據集,卻把從Ling-2.0到Ling-3.0、Ring-2.0到Ring-2.6、再到Ming-Omni及兩款16B-A3B多模態模型的來路,逐份寫明瞭。

MiMo-V2.6剛發,小米羅福莉扔出MiMo-V3新架構!引用DeepSeek多項成果
(公眾號:zhidxcom) 作者 | 江宇 編輯 | 李水青 9月24日報道,昨晚,小米MiMo大模型負責人羅福莉發文,提前披露了MiMo-V3的新架構,其核心組件HySparse2率先登場,相關技術論文同步公佈。▲羅福莉發文 簡單來說,這套新架構主要解決Agent越做越多輪之後出現的三個問題:長輸入算得太多、緩存佔得太大,以及如何從越來越長的上下文裡準確找到需要的信息。

OpenAI、Anthropic同日模型大戰,“是兄弟就砍一刀”
光錐智能2026.09.24 16:43 · 來自廣西全文3968字00:00 / 10:28刀刀見骨,AI巨頭為自己畫過的大餅“填窟窿”文|光錐智能,作者 | 魏琳華 ,編輯|劉俊宏9月23日凌晨,OpenAI和Anthropic像約好了一樣,前後腳各自放出新模型:OpenAI端出了GPT-6 Sol和GPT-6 Luna兩款模型,把旗艦GPT-6 Astra的能力蒸進更快更便宜的型號裡;Anthropic則亮出Claude Opus 5.5,性能追平Fable 5.1的同時,成本只有上代Opus 5的六成。

騰訊混元推出"騰訊 Hy 翻譯"App:支持 33 種語言互譯,覆蓋 5 種民族語言
該產品基於騰訊混元 Hy-MT2 翻譯模型打造,支持 33 種語言互譯,並覆蓋 5 種中國少數民族語言及方言,提供語音翻譯、拍照翻譯與離線翻譯等多種方式。離線可用、覆蓋港澳臺及東南亞據介紹,離線翻譯模式下用戶可提前將翻譯模型下載至手機,在沒有網絡或信號不佳時仍能穩定使用。

谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底
所謂後訓練,是在基礎模型完成後進一步調整、提升行為可靠性的階段。跳過 3.5 Pro,直接押注 Gemini 4卡武克奧盧希望 Gemini 4 在"遠早於年底"的時間點推出,並稱正儘快拿出後訓練階段的早期成果,"因為我們看到了結果,也很振奮",隨後谷歌會繼續快速迭代。