打敗Fable 5!Kimi K3衝上第一,楊植麟導師很驕傲

重點摘要
Kimi 正式發表全球首個開源 3 兆參數級別模型 Kimi K3,參數量達 2.8 兆,性能接近 Claude Fable 5,但價格僅需一半。該模型在多項評測中擊敗眾多閉源模型,包括在專業網頁工程評比中拿下第一,連創辦人楊植麟的博士導師也公開讚賞。
Kimi 正式推出自家迄今為止能力最強的開源模型 Kimi K3,不僅在參數量上衝上新高,更在多家評測榜單中一舉超越備受關注的 Claude Fable 5,登上開源模型的頂點。這款參數量達 2.8 萬億的模型是全球首個開源的 3 萬億參數級別大模型,原生支援視覺理解,並具備 100 萬 token 的上下文視窗,一上線便迅速成為 AI 社群焦點,許多開發者更將此稱為「中國的 Fable 5 時刻」。Kimi 創辦人兼執行長楊植麟的博士生導師、CMU 機器學習領域權威 Russ Salakhutdinov 也特別公開發文,盛讚新版 Kimi 為開源社群帶來了重大突破。
雲端平台 Vercel 創辦人、同時也是 Next.js 作者的 Guillermo Rauch 則在專業網頁工程 AI 評測中公布結果,顯示 Kimi K3 綜合表現在該榜單中排名第一,並指出這是首次有開源模型能在這項權威評比中超越所有海外閉源模型;其程式碼任務成功率達到 92%,開發效率優於同級別的 Claude Fable 5。除了專業評測,社群實測同樣引發熱烈討論。測評博主 aditya 用 Kimi K3 生成一款槍戰遊戲後驚嘆,從未見過 AI 僅憑一個提示就能產出如此令人驚喜的介面,他形容 Kimi K3 就像是中國開源了 Claude Fable 5 等級的模型。
另一名 AI 頭部測評博主 Taelin 則指出,Kimi K3 在某些題目上表現優於 Claude Fable 5,但部分題目表現欠佳,且運算時間是 Claude Fable 5 的十倍,不過他認為以 Claude Sonnet 5 的價格就能買到接近 Claude Fable 5 的開源模型,確實改變了他的看法。在價格方面,Kimi K3 雖然較前一代 Kimi K2.6 有明顯調漲,但相較於頂級閉源模型仍極具競爭力。Kimi K3 每百萬 token 的輸入價格為 20 元(快取未命中),較 Kimi K2.6 的 6.5 元上漲約 207.
69%;快取命中時輸入價格為 2 元,輸出價格則從 27 元調升至 100 元,漲幅約 270.37%。然而對比 Claude Fable 5 API 每百萬 token 輸入 10 美元、輸出 50 美元的定價,Kimi K3 在成本上仍顯著更具優勢。從技術細節來看,Kimi K3 的長程 Agent 執行能力大幅躍進,能將程式編寫、視覺理解、工具呼叫與知識工作串聯成完整的作業流程。
官方展示的案例中,Kimi K3 透過 120 多輪迭代,完成 2800 多次網頁搜索與抓取、1100 多次終端資料提取,並處理 87 份季度報告與 99 份原始 PDF,最終生成一份包含客製圖表、動畫示意圖與互動式視覺化敘事的研究報告。在架構與基礎設施上,Kimi K3 透過 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)等架構升級,搭配更高稀疏性的 MoE 設計,相比 Kimi K2 整體擴展效率提升約 2.5 倍。基準測試方面,Kimi K3 在大模型評測競技場 Arena.
AI 的前端程式碼測試中超越 Claude Fable 5;在第三方獨立測評機構 Vals AI 的綜合測試中則以 74.7 分位居第二,僅次於 Claude Fable 5,並超越 GPT-5.6。此外,在超長時序持續開發 SWE Marathon、軟體逆向 Program Bench、終端運維 Terminal Bench 2.
1 等測試中皆名列前茅;在網頁深度調研 BrowseComp、辦公自動化 Automation Bench、Excel 財務建模 SpreadsheetBench 2 等測試中也取得領先,不過在更貼近真實辦公流程的綜合白領任務評測中仍略遜於 Claude Fable 5。在實測體驗方面,智東西在 Kimi K3 Max 模式下測試了多模態與程式碼生成能力,要求模型製作一個單檔案 HTML 的 3D 橫版格鬥遊戲。結果 Kimi K3 僅一次就完成遊戲建立,且無出現錯誤,不僅遊戲邏輯與元素還原度較前代大幅提升,在畫面精細度上也更接近提示詞要求。
AI 領域記者 Chetaslua 則比較 Kimi K3 與 GPT-5.6 Sol 在 3D 內容生成上的差異,認為 Kimi K3 在創意生成方面表現更突出。開發者 LASCHUK 實際對比後發現,Kimi K3 單次花費僅 0.44 美元,成本約為 Claude Fable 5 的一半,進而質疑高價閉源模型的溢價價值。Kimi K3 現已於 kimi.com、最新版 Kimi 應用、Kimi API 以及 Kimi Code 程式設計助手同步上線,所有用戶可在免費額度內體驗,用完後需付費使用。Kimi 同時預告,Kimi K3 的完整模型權重將於 7 月 27 日前發布。
隨著開源模型持續向超大規模邁進,Kimi K3 不僅展示了從內容生成向複雜任務執行與完整工作流交付的延伸,也彰顯了開源陣營在追趕頂級閉源模型上的驚人速度與成本優勢。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。