打敗Fable 5!Kimi K3衝上第一,楊植麟導師很驕傲
重點摘要
Kimi 正式推出全球首個開源、參數量達 2.8 萬億的模型 Kimi K3,在多項評測中表現超越 Claude Fable 5 等頂尖閉源模型,尤其在程式碼生成與長程任務方面展現強勁實力。該模型雖然定價較前代上漲不少,但仍遠低於 Claude Fable 5,且已上線供用戶免費體驗,完整權重預計於月底開源。
Kimi 於今日正式推出其迄今為止能力最強的開源模型 Kimi K3,這款全球首個達到 3 萬億參數級別的模型,實際參數量為 2.8 萬億,並原生支援視覺理解與 100 萬 token 的上下文視窗。模型一上線便在社群引發熱烈討論,不少網友將其形容為「中國的 Fable 5 時刻」。Kimi 創辦人兼執行長楊植麟的博士指導教授、卡內基美隆大學機器學習權威 Russ Salakhutdinov 也公開發文,肯定新版 Kimi 為開源社群帶來了重大突破。雲端平台 Vercel 創辦人、Next.
js 作者 Guillermo Rauch 公布了專業網頁工程 AI 評測結果,指出 Kimi K3 綜合表現位居第一,且是首次有開源模型在該權威榜單上超越所有海外閉源模型;其程式碼任務成功率達 92%,開發效率優於同級別的 Claude Fable 5。測評部落客 aditya 實際測試後表示,Kimi K3 就像中國開源了 Claude Fable 5 等級的模型,他利用 Kimi K3 生成一款槍戰遊戲,並稱從未見過 AI 僅憑一個提示就能產出如此令人驚喜的介面。
另一位 AI 頭部測評人 Taelin 則觀察到,Kimi K3 在某些題目上表現勝過 Claude Fable 5,部分題目卻表現較差,且運算時間約為 Claude Fable 5 的 10 倍;但他也坦言,能以 Claude Sonnet 5 的價格買到接近 Claude Fable 5 的開源模型,確實改變了他的看法。從技術細節來看,Kimi K3 在長程 Agent 式執行能力上獲得大幅提升,能夠將程式設計、視覺理解、工具調用與知識工作串聯成完整的自動化流程。
官方展示了一個 ASIC 行業 42 年研究網站的案例:Kimi K3 透過 120 多輪迭代,完成 2800 多次網頁搜索與抓取、1100 多次終端數據提取,處理 87 份季度報告與 99 份原始 PDF,最終生成包含客製圖表、動畫示意圖與互動式可視化敘事的研究報告。在基準測試方面,Kimi K3 在大模型評測競技場 Arena.AI 的前端程式碼測試中超越 Claude Fable 5;在第三方獨立評測機構 Vals AI 的綜合測試中獲得 74.7 分,排名第二,超越 GPT-5.6,僅次於 Claude Fable 5。上線前,Kimi K3 曾以 Kivine 為代號在海外引起關注。
開源生態基金會 Super Gemma 創辦人 Jun Song 評價指出,從生成結果來看,「Kimi 明顯比 Opus 強」,並認為 Kimi K3 已達到 Opus 5 的水準。在架構與基礎設施方面,Kimi K3 透過 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)等升級,搭配更高稀疏性的 Mixture of Experts(MoE)設計,顯著提升長序列資訊處理與模型擴展效率。相比前一版本 Kimi K2,整體擴展效率提升約 2.5 倍。
訓練與部署上,該模型從 SFT 階段即採用 MXFP4 權重與 MXFP8 激活的量化感知訓練,並透過平衡專家並行訓練提高吞吐量;針對長上下文推理,Kimi 團隊也向 vLLM 社群貢獻了 KDA 相關實作,使模型在 2.8 萬億參數與百萬 token 上下文條件下仍能控制推理成本。價格方面,Kimi 維持分級計費模式,但較 Kimi K2.6 有明顯調漲:每百萬 token 輸入價格為 20 元(緩存未命中),較 K2.6 的 6.5 元上漲約 207.69%;緩存命中時輸入價格為 2 元,先前為 1.1 元;輸出價格則從 27 元調升至 100 元,漲幅約 270.37%。
但與頂級閉源模型相比仍具優勢,例如 Claude Fable 5 的 API 輸入與輸出價格分別為每百萬 token 10 美元(約 67.78 元人民幣)與 50 美元(約 338.88 元人民幣),明顯高於 Kimi K3。Kimi K3 現已上線 kimi.com、最新版 Kimi 應用、Kimi API 與 Kimi Code 程式設計助手,所有用戶可在免費額度內體驗,額度用完後需付費使用。官方表示,完整模型權重將於 7 月 27 日前開源釋出。
在實測環節,智東西於 Kimi K3 Max 模式下測試其多模態與程式碼生成能力,要求模型製作一個 3D 橫版格鬥遊戲,場景設定為被霸天虎入侵的破敗城市,敵人為類人型賽博坦機器人,並包含武器後座力效果、低多邊形風格與卡通美學,且須包含可擊倒的汽車、樹木、瓦礫與自動販賣機等細節物品。Kimi K3 僅用一次即完成遊戲創建,且未出現錯誤。相較於 Kimi K2.6,新版模型對提示詞的理解更精確,沒有出現讓玩家上下移動的詭異設計,畫面精細度與人物造型更貼近要求,甚至在未提示的情況下自動提供射擊與擊打兩種攻擊模式。不過由於使用人數激增,智東西在進行第二項測試時一度被系統告知暫時無法使用。
海外網友與開發者也紛紛進行各類實測。AI 領域記者 Chetaslua 比較了 Kimi K3 與 GPT-5.6 Sol 在 3D 內容生成上的差異,認為兩者輸出效果雖接近,但實現路徑明顯不同,Kimi K3 在創意生成方面表現更突出。有網友用 Kimi K3 生成了達文西工坊模擬器,重現文藝復興時期的撲翼機設計,不僅還原視覺風格,還融入材料、結構與空氣動力學知識,展現跨領域整合能力。測評部落客 aditya 將 Kimi K3 與 GPT-5.6、Claude Fable 5、Grok 4.5 在 3D 遊戲生成任務中同場較量,發現它們性能不相上下,但 Kimi K3 單次調用成本僅 0.
71 美元(約 4.81 元人民幣),遠低於競爭對手;更驚人的是它能解決其他模型察覺不到的隱性問題。開發者 LASCHUK 則實測對比 Kimi K3 與 Claude Fable 5,同樣要求複刻蘋果官網,兩者都能完成任務,但 Kimi K3 單次花費僅 0.44 美元(約 2.98 元人民幣),僅為 Claude Fable 5 的一半,令他質疑高價閉源模型的溢價價值。在程式設計領域,Kimi K3 不僅能理解大型程式碼庫、調用終端工具並持續完成長時間的軟體開發任務,還能參與 GPU 內核優化、編譯器開發、晶片設計等高複雜度工程工作。
Kimi 展示了該模型從零開始構建 GPU 程式設計系統的案例,開發出類似 Triton 的編譯器 MiniTriton,能將開發者編寫的程式轉換為 GPU 可執行的程式碼,並在部分場景下性能達到甚至超越現有工具。Kimi K3 還能設計晶片:在連續 48 小時的自主 Agent 運行中,模型基於開源 EDA 工具與 Nangate 45nm 製程庫,獨立完成晶片的構建、優化與驗證。此外,它可將科學文獻中的方法轉化為可執行程式碼,完成從論文理解、程式碼實作到實驗分析的完整科研計算流程。
在知識生成領域,Kimi K3 能自主蒐集與分析大量資料,生成包含互動式圖表、時間線、漏斗圖與甘特圖的諮詢風格行業報告;也能分析 391 個引力波事件,產生 7 張科學可視化圖、2 張表格,並綜合 10 多篇論文內容。Kimi K3 甚至能製作 3Blue1Brown 風格的動態圖形講解影片,以及從 56 段原始素材自主剪輯品牌宣傳影片,較人工快上數天。Kimi K3 也進一步強化了模型互動的可視化與持續管理能力,推出「小組件」與「看板」功能。小組件支援在對話中生成可互動內容,並連接本地數據或外部外掛實現動態更新;看板則能集中管理多個小組件,形成圍繞特定項目、主題或目標的長期工作空間。
在多維度評測中,Kimi K3 在超長時序持續開發 SWE Marathon、軟體逆向 Program Bench、終端運維 Terminal Bench 2.1 等測試中表現突出,其中 SWE Marathon 與 Program Bench 均取得第一,Terminal Bench 2.1 達 88.3 分,與 GPT-5.6 Sol 接近;在高難度軟體工程任務 FrontierSWE 中以 81.2 分位居第二,僅次於 Claude Fable 5。
在網頁深度調研 BrowseComp、辦公自動化 Automation Bench、Excel 財務建模 SpreadsheetBench 2 等測試中亦取得領先,其中 BrowseComp 達 91.2 分。不過,在更貼近真實辦公流程的綜合白領任務 GDPval-AA v2 與 APEX-Agents 等評測中,Kimi K3 仍弱於 Claude Fable 5 等頂級閉源模型。視覺能力方面,Kimi K3 在圖表理解 CharXiv 與文件分析 OmniDocBench 等任務中表現較強,其中 OmniDocBench 達 91.
1 分,但在零樣本視覺工具任務 Zerobench 上仍低於 Claude Fable 5。Kimi 內部也測試了 Kimi K3 的工程能力,在 GPU 內核優化測試中,模型需自主完成程式碼分析、內核重寫與性能驗證,覆蓋 AttnRes、KDA、MLA 等 GPU 計算任務。結果顯示,在最高推理強度下,Kimi K3 表現接近 Claude Fable 5(含回退機制),並超越 Claude Opus 4.8、GPT-5.6 Sol 與 GPT-5.5。
在知識工作方面,Kimi 內部測試顯示,統一開啟最高深度思考模式後,Kimi K3 在通用推理、深度文件分析與金融專項三類任務中的表現均超過 GPT-5.5 與 Claude Opus 4.8。據官方部落格說明,從去年 7 月至今,Kimi 模型一直保持著開源模型的規模上限,參數量維持在 1 萬億以上;今日推出的 Kimi K3 則是首個參數量達到 2.8 萬億的開源模型,主要得益於 KDA 與 AttnRes 兩項架構更新,使資訊能在更長序列與更深模型中流動得更順暢。結合 Stable LatentMoE 框架後,模型可在 896 個專家中高效啟動 16 個,進一步擴大 MoE 稀疏度。
安全與可靠性方面,Kimi 坦承 Kimi K3 仍存在一些使用限制。由於模型在保留思維歷史的模式下訓練,若 Agent 框架未正確返回完整歷史內容,或用戶在會話中從其他模型切換到 K3,生成品質可能不穩定。此外,Kimi K3 針對長期複雜任務進行了強化訓練,在用戶意圖不明確時可能表現得過於主動,官方建議在系統提示詞或 AGENTS.md 中設定更明確的行為邊界。Kimi 也承認,儘管 Kimi K3 具備較強競爭力,用戶體驗相比 Claude Fable 5、GPT 5.6 Sol 等頂級閉源模型仍存在差距。
整體而言,Kimi K3 的發布不僅推動開源模型向超大規模邁進,更重要的是展示了大型語言模型從單純內容生成向複雜任務執行與完整工作流交付的延伸。從長時間程式碼開發、GPU 工程優化,到產業研究、科研分析與多模態創作,Kimi K3 體現了開源模型在實務應用上的潛力。然而,隨著模型規模持續擴大,如何進一步提升推理效率、降低使用成本,並縮小與頂級閉源模型在實際體驗上的差距,將是後續發展需要持續克服的課題。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。