Kimi K3 發佈 47 頁技術報告,最有價值的創新點是這些
重點摘要
它把架構、訓練和 Agent infra連接成了一套完整系統。 作者丨鄭佳美 編輯丨馬曉寧 Kimi K3 發佈開放權重,最搶眼的數字有三個:2.8T 總參數、104B 激活參數,以及 100 萬 token 上下文。這些數字當然重要,但讀完 47 頁技術報告會發現,它們更多是技術改造後的結果,而不是這份報告真正值得關注的部分。
Kimi K3 開放權重模型正式發表,隨之公開的 47 頁技術報告在業界引發討論。報告中最引人注目的數字包括 2.8T 總參數、104B 激活參數與 100 萬 token 上下文,但這些指標更像是技術改造後的成果,而非報告真正值得關注的核心。Kimi K3 的設計出發點更為務實:當模型持續擴大、上下文不斷增長,且 Agent 任務可能延續數小時之際,傳統 Transformer 架構與訓練系統能否勝任?上下文變長會導致 KV Cache 急遽膨脹;網路加深使前期訊息逐漸稀釋;專家數量上升則帶來路由、通訊與負載問題;Agent 軌跡拉長後,強化學習又容易被少數慢任務拖住。
Kimi K3 沒有選擇單純增加 GPU,而是從架構、訓練到 Agent 基礎設施進行系統性改造,將原本會隨規模膨脹的計算與狀態,轉換為可壓縮、可調度、可暫停與恢復的結構。三大架構革新分別處理 Transformer 在序列、深度與寬度上的擴展問題。在序列方面,傳統注意力機制需保存所有歷史 token 的 Key 與 Value,上下文越長則 KV Cache 越大。Kimi Delta Attention(KDA)採用固定大小的遞歸狀態,模型在閱讀過程中不斷更新壓縮記憶,避免狀態隨序列線性膨脹。
但壓縮必然損失部分細節,因此 Kimi K3 在每個模塊中安排三層 KDA 與一層 Gated MLA,並在模型末尾保留全局注意力:KDA 負責低成本更新長期狀態,MLA 定期重新檢視完整上下文,兩者分工明確。此外,KDA 的衰減參數經調整設有下界,使相關計算可統一轉換為稠密矩陣乘法,更符合 GPU 的運算特性。在深度方面,標準殘差連接會將各層輸出疊加到同一隱藏狀態,網路加深後前層資訊容易混雜。Kimi K3 引入 Attention Residuals(AttnRes),允許當前層對前面不同深度的表示進行加權選擇,如同保留檔案的多個中間版本,後層可依需要重新調用。
為控制顯存與通訊成本,模型約每 12 層聚合為一個 Block,對不同 Block 的表示進行選擇,而非保留全部 93 層的獨立輸出。這項設計不依賴 2.8T 參數,也不須搭配 KDA 或 MoE,可望成為其他模型改進深層網絡的參考結構。在寬度方面,Kimi K3 每層擁有 896 個路由專家,每個 token 選取 16 個。專家池擴大帶來通訊、顯存與負載不均衡的挑戰。模型使用 LatentMoE,先將 7168 維隱藏狀態壓縮至 3584 維,讓路由專家在較窄空間計算,再映射回完整維度,從而控制通訊增長。
為避免連續壓縮與放大導致異常激活,專家聚合後加入 RMSNorm,並以 SiTU-GLU 取代 SwiGLU,使數值過大時自動限幅。設備負載則透過 Quantile Balancing 解決,它根據整批路由分數的分位數直接計算每個專家所需的偏置,避免傳統步長調整的震盪;訓練系統中的 MoonEP 則為熱門專家建立動態副本,使各設備接收相同數量的 token,與 Quantile Balancing 協同達成負載均衡。然而,要讓 Agent 連續工作數小時,真正困難的部分往往發生在強化學習系統中。傳統同步強化學習會等待整批任務完成,只要少數長任務拖慢,所有 GPU 都受影響。
Kimi K3 採用 partial rollout,只要部分軌跡完成就先更新模型,未完成的暫停後再恢復。這導致數據來源不一致(off-policy),但模型透過逐 token 正則限制策略變化,使訓練能容忍這種異步性。更關鍵的是保存外部環境狀態:Kimi K3 的 AgentENV 基於 Firecracker microVM,支援 sandbox 的暫停、恢復、複製與快照。訓練與評估期間共創建超過 5100 萬個 sandbox,它們可在等待模型推理時暫停,避免持續佔用 CPU 和記憶體,任務恢復時檔案系統與程序狀態也同步還原。
這使得數小時的 Agent 軌跡能反覆暫停與繼續,長程任務因此真正納入強化學習訓練範疇。多模態能力在此扮演重要的回饋角色。Kimi K3 的視覺編碼器 MoonViT-V2 從零開始訓練,未使用預訓練對比學習模型初始化,結果更穩定且最終能力接近預訓練方案。多模態訓練資料包含大量程式碼與渲染結果配對,例如網頁、SVG、遊戲或 CAD 圖形。模型可先編寫程式碼,執行後查看截圖,再根據實際畫面修正。視覺因此成為 Agent 的回饋通道,模型不再只能猜測結果,而是能真正觀察自己生成的內容並據以調整,形成保存任務狀態、持續執行工具、觀察真實結果、根據回饋修正下一步的完整閉環。
這樣的長程執行能力在 Kernel 優化任務中充分體現。以 AttnRes Kernel 為例,Kimi K3 在十多個小時內持續嘗試、測試與修改,最終將相對 FLA Triton 基線的加速幅度提升至 59.7%。DSA Kernel 優化任務中,模型經過接近 24 小時的不斷編寫、運行與分析,達到 55.1% 加速,僅次於 Claude Fable 5 的 57.3%,高於 GPT-5.6 Sol、Claude Opus 4.8 與 GPT-5.5。KDA-GPGPU Kernel 任務中,Kimi K3 在超過 20 小時的實驗中將加速幅度提升至 73.6%,明顯超越其他對比模型。
這些成果凸顯長程 Agent 的價值不在於一次性生成優異程式碼,而在於能保留已發現的有效方案,並在多輪嘗試中持續突破。報告指出,Kimi K3 相較 Kimi K2 獲得約 2.5 倍的整體 scaling efficiency,這意味在擬合的 scaling law 中,達到相同驗證損失所需計算量更少,或在相同計算量下可獲得更低損失。但這不等於訓練成本降低 60%,也不代表推理速度提升 2.5 倍。Kimi K3 總參數從約 1.04T 增至 2.78T,激活參數從 32.6B 增至 104.2B,層數從 61 增至 93,無論訓練或部署,它仍然是一個更重、更昂貴的模型。這個 2.
5 倍來自 KDA、AttnRes、LatentMoE、數據處理、優化器與超參數搜索的綜合作用,報告未進行完整的逐項消融,因此不能歸功於單一模組。Kimi K3 已進入當前模型第一梯隊,尤其擅長程式設計、搜尋、專業工作流與長程工具調用。但它的優勢往往建立在較高的推理投入之上:模型會執行更多步驟、使用更多輸出 token、花更長時間檢查與修正。這與其訓練方向一致,對軟體工程、數據分析與複雜研究極有價值,但對於簡單問答則可能顯得緩慢且高昂。官方評測混合使用了不同 Agent Harness,部分結果來自內部數據集,成績反映的是「模型加工具系統」的綜合表現,而非裸模型比較。
這也顯示進入 Agent 階段後,模型能力已難以與執行環境徹底分開。綜合來看,Kimi K3 最值得關注的不是單一技巧,而是它將架構、訓練與 Agent 基礎設施串聯成一套完整系統。KDA、AttnRes 與 Stable LatentMoE 讓模型在更大規模下控制快取、通訊與數值穩定性;partial rollout、外部 KV Cache 與可恢復 microVM 讓長時任務真正進入強化學習;原生多模態視覺則提供執行結果的回饋。
當模型開始連續工作數小時,其能力上限不再只是「下一句話生成得好不好」,而是能否保存工作進度、保留執行現場、看到實際結果、發現錯誤並持續完成任務——這或許是 Kimi K3 技術報告真正有價值的訊息。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。