剛剛,Kimi K3開源!2.8萬億參數砸向全球,硅谷巨頭看傻了
重點摘要
智東西 作者 | 茄子 編輯 | 李水青 智東西7月28日報道,剛剛,月之暗面發佈Kimi K3的模型權重、技術報告,並開源支撐Kimi K3模型訓練的關鍵Infra技術:MoonEP、FlashKDA和AgentEnv。 Hugging Face CEO Clem Delangue發文,Kimi K3 30分鐘內以超過4000個贊登頂趨勢榜,迄今為止最快的發佈增長速度!
月之暗面(Moonshot AI)於7月28日正式釋出Kimi K3的模型權重、技術報告,並同步開源支援模型訓練的三大關鍵基礎設施技術:MoonEP、FlashKDA 與 AgentEnv。這款擁有2.8萬億參數的混合專家(MoE)模型在開源後立即引發全球關注,Hugging Face 執行長 Clem Delangue 在社群平台發文指出,Kimi K3 在30分鐘內以超過4000個讚登上趨勢榜榜首,寫下該平台迄今最快的發布增長速度。Kimi K3 其實早在7月17日便已發表,當時憑藉亮眼的基準測試成績與實際體驗,被不少網友稱為「中國的 Fable 5 時刻」。
此次開源更讓全球開發者能夠自由下載部署模型,無論是用於內部研發或嵌入終端產品,均可自由使用。隨模型一同開源的三項 Infra 技術各有專攻:MoonEP 是專為超大細粒度 MoE 設計的高性能通訊庫,能在專家並行通訊不均衡的情況下維持極致效率;FlashKDA 是 Kimi Delta Attention 的高性能運算算子,在 NVIDIA H20 上可將 prefill 速度提升至 flash-linear-attention 基線的 1.72 至 2.22 倍,且能直接作為替換後端使用;AgentEnv 則是與 KVCache.
ai 合作開發的沙箱系統,可為大規模 Agent 訓練提供高保真、強隔離的執行環境,並支援快速快照、還原與分支,應對大規模並行工作流程。在模型架構方面,Kimi K3 採用 KDA 與 AttnRes 以 3:1 比例混合 KDA 與 Gated MLA,透過區塊級注意力殘差增強跨層資訊流動,實現高效的長上下文建模。Stable LatentMoE 讓每個 token 從 896 個路由專家中啟動 16 個,結合 SiTU-GLU 與 Quantile Balancing,在極高稀疏度下維持訓練穩定。
視覺編碼器 MoonViT-V2 則從零開始使用 next-token prediction 訓練,無需對比預訓練即可達到基線效果並獲得更穩定的最佳化過程。後訓練方面,模型在通用推理、通用 Agent 與程式設計 Agent 三大領域進行大規模任務合成,搭配百萬 token 上下文的強化學習基礎建設,完成近 20 個內部評測集的完整評估。多項評測結果顯示,Kimi K3 在程式設計、Agent 任務與視覺理解等面向展現出強大能力。程式設計方面,在超長時序持續開發測試 SWE Marathon、軟體逆向 Program Bench、終端運維 Terminal Bench 2.
1 等項目中表現突出,其中 SWE Marathon 與 Program Bench 均取得第一,Terminal Bench 2.1 達到 88.3 分,與 GPT-5.6 Sol 接近;在高難度軟體工程任務 FrontierSWE 中則以 81.2 分位列第二,僅次於 Claude Fable 5。Agent 與知識工作場景方面,模型在網頁深度調研 BrowseComp、辦公自動化 Automation Bench、Excel 財務建模 SpreadsheetBench 2 等測試中取得領先,其中 BrowseComp 達 91.
2 分,Automation Bench 與 SpreadsheetBench 2 均排名第一;不過在綜合白領任務 GDPval-AA v2、APEX-Agents 等更貼近真實辦公流程的評測中,Kimi K3 仍弱於 Claude Fable 5 等頂級閉源模型。視覺能力方面,Kimi K3 在圖表理解 CharXiv、文件分析 OmniDocBench 等任務中表現突出,其中 OmniDocBench 達到 91.1 分,超越多款對比模型;但在部分視覺推理任務如零樣本視覺工具任務 Zerobench 上,仍低於 Claude Fable 5。
月之暗面內部也測試了模型的工程能力,在 GPU 核心最佳化測試中,Kimi K3 需自主完成程式碼分析、核心改寫與效能驗證,涵蓋 AttnRes、KDA、MLA 等 GPU 運算任務,結果顯示在最高推理強度下其表現接近 Claude Fable 5(含回退機制),並超過 Claude Opus 4.8、GPT-5.6 Sol 與 GPT-5.5。知識工作方面,在統一開啟最高深度思考模式後,Kimi K3 在通用推理、深度文件分析與金融專項三類任務中的表現均超過 GPT-5.5 與 Claude Opus 4.8。實際測試中,Kimi K3 在複雜任務上展現出令人印象深刻的執行力。
以生成 3D 橫版格鬥遊戲為例,提示詞設定包括「被霸天虎入侵的破敗城市地圖」、「低多邊形風格」、「5 種擎天柱陣營角色」、「5 種霸天虎變種敵人」等複雜條件,Kimi K3 僅用一次就完成遊戲建立,未出現錯誤。海外開發者 @He1s_Sammy 在遊戲設計場景下對比 Kimi K3、GPT-5.6 Sol 與 Fable 5 三款模型,輸入完全相同提示詞後評估方案品質、遊玩體驗與呼叫成本,結果顯示 Kimi K3 表現最優,能抓住玩法核心且產出節奏自然,而 Fable 5 與 GPT-5.6 Sol 的遊戲節奏普遍過快;成本方面,Kimi K3 呼叫費用為 0.
03 美元(約新台幣 1 元),遠低於 Fable 5 的 0.38 美元與 GPT-5.6 Sol 的 0.11 美元。在更長程的任務執行案例中,Kimi K3 也展現出高度自主性。晶片設計方面,模型基於開源 EDA 工具與 Nangate 45nm 製程庫,在 48 小時連續自主運作中獨立完成晶片的建構、最佳化與驗證。科研領域中,Kimi K3 一次分析 391 個 GWTC-5 重力波事件,呼叫 20 多個並發子智能體,產出 7 張科學視覺化圖、2 張表格,並綜合 10 多篇論文文獻。
GPU 程式設計方面,模型從零開發類似 Triton 的編譯器 MiniTriton,可將開發者編寫的程式轉換為 GPU 可執行程式碼,部分場景效能甚至超越現有工具。Kimi K3 開源後獲得海外業界廣泛迴響。北美 AI 基礎設施新創 OsmanticAI 創辦人兼執行長 Ahmad 將 Kimi K3 稱為「本地版 Fable 5」,並強烈建議大家下載體驗,直言「這樣他們永遠也奪不走我的 Fable 5」。美國 AI 新創 Cognition(數位員工 Devin 的開發主體)宣布 Kimi K3 已接入 Devin 桌面客戶端與命令列工具(CLI),並表示在 FrontierCode 1.
1 評測基準上,Kimi K3 是他們測試過首款性能逼近前沿水準的開源模型。Nebius、Baseten、Fireworks 等海外 AI 基礎設施廠商隨即宣布 Day 0 適配,Nebius 更指出 Kimi K3 是首個達到前沿性能水準的開放權重模型,是開放模型發展歷程中的一大進步。中國廠商同樣快速跟進。華為昇騰 CANN 宣布對模型 MXFP4 量化實現 Day 0 原生支援,並提供在昇騰 950PR/DT 系列與 Atlas A3 系列叢集上的部署實踐。
趨境科技則宣布,基於開源大模型推理引擎 SGLang 完成 Kimi K3 在華為昇騰 910C 超節點上的 Day 0 適配,並同步開源相關成果。社群在模型上線前的討論也相當熱烈。有網友發文戲稱 Hugging Face 甚至為 Kimi K3 做了預熱網頁;截至上線前半小時,已有近 3700 名開發者在等待上線,上線前 10 分鐘頁面還短暫出現過 404 錯誤。對比半年前 DeepSeek-V3 開源時,海外社群的討論多半圍繞「又一個中國模型」;到了 Kimi K3,話題已轉變為「它比 Claude Opus 強」、「開發者正在把 Fable 換成 K3」。然而影響力擴大也意味著風險增加。
Kimi K3 開源引發熱議之際,美國參議員蒂姆·斯科特與比爾·哈格蒂提案擴大商務部權限以限制外國對手接觸 AI 技術;美國商務部去年曾考慮將月之暗面、DeepSeek、阿里 Qwen 團隊等中國 AI 實驗室列入實體清單,白宮也曾考慮透過行政令要求使用中國模型的美國企業對安全事件承擔責任。OpenAI、Anthropic 等美國閉源 AI 企業先前提案禁用中國開源模型。中國商務部回應稱這是「典型的人工智慧霸權主義行徑」,並指出近 200 家美國新創企業敦促政府不要切斷對中國開源模型的訪問,認為這將削弱美國企業競爭力。當美國企業自身也在使用中國開源模型時,制裁的合理性備受挑戰。
AI 能力正從少數公司的技術優勢轉變為全球開發者可調用的基礎工具,這股趨勢不會因為一紙制裁令而改變。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。