雷峰網生成式AI

Kimi K3 發佈 47 頁技術報告,最有價值的創新點是這些

2026年7月28日 06:37

重點摘要

它把架構、訓練和 Agent infra連接成了一套完整系統。 作者丨鄭佳美 編輯丨馬曉寧 Kimi K3 發佈開放權重,最搶眼的數字有三個:2.8T 總參數、104B 激活參數,以及 100 萬 token 上下文。這些數字當然重要,但讀完 47 頁技術報告會發現,它們更多是技術改造後的結果,而不是這份報告真正值得關注的部分。

站內 AI 整理稿

Kimi K3 開放權重模型正式發表,隨之公開的 47 頁技術報告在業界引發討論。報告中最引人注目的數字包括 2.8T 總參數、104B 激活參數與 100 萬 token 上下文,但這些指標更像是技術改造後的成果,而非報告真正值得關注的核心。Kimi K3 的設計出發點更為務實:當模型持續擴大、上下文不斷增長,且 Agent 任務可能延續數小時之際,傳統 Transformer 架構與訓練系統能否勝任?上下文變長會導致 KV Cache 急遽膨脹;網路加深使前期訊息逐漸稀釋;專家數量上升則帶來路由、通訊與負載問題;Agent 軌跡拉長後,強化學習又容易被少數慢任務拖住。Kimi K3 沒有選擇單純增加 GPU,而是從架構、訓練到 Agent 基礎設施進行系統性改造,將原本會隨規模膨脹的計算與狀態,轉換為可壓縮、可調度、可暫停與恢復的結構。 三大架構革新分別處理 Transformer 在序列、深度與寬度上的擴展問題。在序列方面,傳統注意力機制需保存所有歷史 token 的 Key 與 Value,上下文越長則 KV Cache 越大。Kimi Delta Attention(KDA)採用固定大小的遞歸狀態,模型在閱讀過程中不斷更新壓縮記憶,避免狀態隨序列線性膨脹。但壓縮必然損失部分細節,因此 Kimi K3 在每個模塊中安排三層 KDA 與一層 Gated MLA,並在模型末尾保留全局注意力:KDA 負責低成本更新長期狀態,MLA 定期重新檢視完整上下文,兩者分工明確。此外,KDA 的衰減參數經調整設有下界,使相關計算可統一轉換為稠密矩陣乘法,更符合 GPU 的運算特性。 在深度方面,標準殘差連接會將各層輸出疊加到同一隱藏狀態,網路加深後前層資訊容易混雜。Kimi K3 引入 Attention Residuals(AttnRes),允許當前層對前面不同深度的表示進行加權選擇,如同保留檔案的多個中間版本,後層可依需要重新調用。為控制顯存與通訊成本,模型約每 12 層聚合為一個 Block,對不同 Block 的表示進行選擇,而非保留全部 93 層的獨立輸出。這項設計不依賴 2.8T 參數,也不須搭配 KDA 或 MoE,可望成為其他模型改進深層網絡的參考結構。 在寬度方面,Kimi K3 每層擁有 896 個路由專家,每個 token 選取 16 個。專家池擴大帶來通訊、顯存與負載不均衡的挑戰。模型使用 LatentMoE,先將 7168 維隱藏狀態壓縮至 3584 維,讓路由專家在較窄空間計算,再映射回完整維度,從而控制通訊增長。為避免連續壓縮與放大導致異常激活,專家聚合後加入 RMSNorm,並以 SiTU-GLU 取代 SwiGLU,使數值過大時自動限幅。設備負載則透過 Quantile Balancing 解決,它根據整批路由分數的分位數直接計算每個專家所需的偏置,避免傳統步長調整的震盪;訓練系統中的 MoonEP 則為熱門專家建立動態副本,使各設備接收相同數量的 token,與 Quantile Balancing 協同達成負載均衡。 然而,要讓 Agent 連續工作數小時,真正困難的部分往往發生在強化學習系統中。傳統同步強化學習會等待整批任務完成,只要少數長任務拖慢,所有 GPU 都受影響。Kimi K3 採用 partial rollout,只要部分軌跡完成就先更新模型,未完成的暫停後再恢復。這導致數據來源不一致(off-policy),但模型透過逐 token 正則限制策略變化,使訓練能容忍這種異步性。更關鍵的是保存外部環境狀態:Kimi K3 的 AgentENV 基於 Firecracker microVM,支援 sandbox 的暫停、恢復、複製與快照。訓練與評估期間共創建超過 5100 萬個 sandbox,它們可在等待模型推理時暫停,避免持續佔用 CPU 和記憶體,任務恢復時檔案系統與程序狀態也同步還原。這使得數小時的 Agent 軌跡能反覆暫停與繼續,長程任務因此真正納入強化學習訓練範疇。 多模態能力在此扮演重要的回饋角色。Kimi K3 的視覺編碼器 MoonViT-V2 從零開始訓練,未使用預訓練對比學習模型初始化,結果更穩定且最終能力接近預訓練方案。多模態訓練資料包含大量程式碼與渲染結果配對,例如網頁、SVG、遊戲或 CAD 圖形。模型可先編寫程式碼,執行後查看截圖,再根據實際畫面修正。視覺因此成為 Agent 的回饋通道,模型不再只能猜測結果,而是能真正觀察自己生成的內容並據以調整,形成保存任務狀態、持續執行工具、觀察真實結果、根據回饋修正下一步的完整閉環。 這樣的長程執行能力在 Kernel 優化任務中充分體現。以 AttnRes Kernel 為例,Kimi K3 在十多個小時內持續嘗試、測試與修改,最終將相對 FLA Triton 基線的加速幅度提升至 59.7%。DSA Kernel 優化任務中,模型經過接近 24 小時的不斷編寫、運行與分析,達到 55.1% 加速,僅次於 Claude Fable 5 的 57.3%,高於 GPT-5.6 Sol、Claude Opus 4.8 與 GPT-5.5。KDA-GPGPU Kernel 任務中,Kimi K3 在超過 20 小時的實驗中將加速幅度提升至 73.6%,明顯超越其他對比模型。這些成果凸顯長程 Agent 的價值不在於一次性生成優異程式碼,而在於能保留已發現的有效方案,並在多輪嘗試中持續突破。 報告指出,Kimi K3 相較 Kimi K2 獲得約 2.5 倍的整體 scaling efficiency,這意味在擬合的 scaling law 中,達到相同驗證損失所需計算量更少,或在相同計算量下可獲得更低損失。但這不等於訓練成本降低 60%,也不代表推理速度提升 2.5 倍。Kimi K3 總參數從約 1.04T 增至 2.78T,激活參數從 32.6B 增至 104.2B,層數從 61 增至 93,無論訓練或部署,它仍然是一個更重、更昂貴的模型。這個 2.5 倍來自 KDA、AttnRes、LatentMoE、數據處理、優化器與超參數搜索的綜合作用,報告未進行完整的逐項消融,因此不能歸功於單一模組。 Kimi K3 已進入當前模型第一梯隊,尤其擅長程式設計、搜尋、專業工作流與長程工具調用。但它的優勢往往建立在較高的推理投入之上:模型會執行更多步驟、使用更多輸出 token、花更長時間檢查與修正。這與其訓練方向一致,對軟體工程、數據分析與複雜研究極有價值,但對於簡單問答則可能顯得緩慢且高昂。官方評測混合使用了不同 Agent Harness,部分結果來自內部數據集,成績反映的是「模型加工具系統」的綜合表現,而非裸模型比較。這也顯示進入 Agent 階段後,模型能力已難以與執行環境徹底分開。 綜合來看,Kimi K3 最值得關注的不是單一技巧,而是它將架構、訓練與 Agent 基礎設施串聯成一套完整系統。KDA、AttnRes 與 Stable LatentMoE 讓模型在更大規模下控制快取、通訊與數值穩定性;partial rollout、外部 KV Cache 與可恢復 microVM 讓長時任務真正進入強化學習;原生多模態視覺則提供執行結果的回饋。當模型開始連續工作數小時,其能力上限不再只是「下一句話生成得好不好」,而是能否保存工作進度、保留執行現場、看到實際結果、發現錯誤並持續完成任務——這或許是 Kimi K3 技術報告真正有價值的訊息。

Related

相關文章

湯臣倍健,悄悄投了AI半壁江山

# 湯臣倍健,悄悄投了AI半壁江山 一家保健品公司,成了梁文鋒和楊植麟的共同點。 2026年最魔幻的商業敘事之一,是保健品龍頭湯臣倍健成了中國AI大模型賽道最活躍的跨界玩家。從DeepSeek到月之暗面,從階躍星辰到兩家硬科技芯片公司,這家賣蛋白粉的企業在短短數月內合計投入約4.5億元,精準押中了多家頭部AI公司。 ## 一場意外的估值曝光 DeepSeek成立以來從未公開披露具體融資估值,市場傳聞從2000億到5000億滿天飛。結果捅破這層窗戶紙的,是兩家A股公司——賣箱包的開潤股份,以及賣保健品的湯臣倍健。

剛剛

硅谷開始在大模型上“消費降級”了

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦浙江最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作硅谷開始在大模型上“消費降級”了硅基星芒·2026年07月28日 17:35從炫耀性消費到算計性生存 2026年7月24日,《華爾街日報》一篇報道的標題平淡無奇,內容卻是一道分水嶺:美國企業界正在集體停止在大模型調用上燒錢。 過去兩年,企業以“Token最大化”為榮。內部排行榜上,誰的API調用費用最高,誰就是數字化轉型的急先鋒。如今這套敘事被徹底翻轉,省錢成了新信仰,節儉成了新美德。 Cursor這家即將被馬斯克以600億美元收購的公司,為這場運動發明瞭一個精準的詞:tokenomics,Token經濟學。它的前投資銀行家、現任現場首席技術官Mike Saeks用一個比喻道破了這場轉向的核心:“用最強大的模型處理日常任務,就像開著蘭博基尼去雜貨店買牛奶,那車是為了賽道而生的。” 種種跡象證明,這不是一句俏皮話,它是對過去兩年AI泡沫敘事的清算的開始。 從炫耀性消費到算計性生存 這場轉向的速度之快,連最敏銳的觀察者都措手不及。 幾個月前,企業還在攀比誰的AI賬單更嚇人。Token最大化是一個充滿硅谷氣質的詞:把浪費包裝成進取,把燒錢曲解為信仰。那時的邏輯是,用得越多意味著AI化越徹底,花得越狠意味著技術領先越明顯。

剛剛
IT之家生成式AI

英偉達 CEO 黃仁勳:AI 消滅的是任務,而非工作

首頁 > 智能時代>人工智能 英偉達 CEO 黃仁勳:AI 消滅的是任務,而非工作 2026/7/28 17:45:52 來源:IT之家 作者:遠洋 責編:遠洋 評論: IT之家 7 月 28 日消息,英偉達 CEO 黃仁勳並不認同所謂“白領大屠殺”的說法。在 Y Combinator 創業學校(Startup School)的演講中,黃仁勳回應了外界對 AI 的種種悲觀預測。

剛剛
IT之家生成式AI

消息稱亞馬遜大規模調整 AI 戰略,集中資源攻堅前沿大模型

**亚马逊调整AI战略:聚焦前沿模型研发,逐步停更多款Nova系列模型** 据IT之家援引Business Insider报道,知情人士透露,亚马逊正在对其人工智能战略进行大规模调整。此次调整包括逐步停止多款自研AI模型的开发、重组相关团队,并将工程资源与算力集中投入到代号为FMR(Frontier Model Research)的前沿模型项目中。这标志着亚马逊在AI领域的布局进入重心转移的新阶段。 该调整紧跟上月亚马逊对通用人工智能(AGI)部门的裁员,以及关闭成立于2024年的AGI Lab研究团队。

剛剛

GPT“失控”被索賠1億美元,微軟反手扔王炸:新模型踩翻Mythos、價格砍半,還拉上“苦主”組了聯盟

### 微軟趁機“組局”:聯手Hugging Face等37家企業成立安全聯盟,OpenAI與Anthropic被排除在外 就在OpenAI因模型“失控”入侵事件被索賠1億美元、輿論譁然的第二天,微軟沒有選擇沉默,而是迅速“落井下石”,丟出了一連串重磅炸彈。這家科技巨頭不僅發佈了號稱性能碾壓所有競品、成本僅一半的網絡安全專用模型,更直接拉上了此次事件的“苦主”Hugging Face,聯合英偉達等37家企業成立了一個全新的“開放安全AI聯盟”(Open Secure AI Alliance)。

剛剛

Kimi K3 一開源,Anthropic 終於不裝了

好的,這是一篇根據您提供的資料,以「36氪」風格撰寫的完整新聞稿。 --- ### Kimi K3 一開源,Anthropic 終於不裝了 科技的浪潮或許還是要從開源中湧現。一箇中國開源模型,再次引發整個硅谷科技巨頭「地震」。這個熟悉的劇情,上次的主角是 DeepSeek R1,這次則是剛剛開源的 Kimi K3。它的出現,甚至讓英偉達和 Anthropic 公開站到了對立面上,一場關於「開放」與「安全」的論戰正在白熱化。

剛剛