Kimi K3 正式公佈焚訣,這下它真成活菩薩了?

2026年7月29日 09:45
Kimi K3 正式公佈焚訣,這下它真成活菩薩了?

重點摘要

# Kimi K3 正式公佈焚訣,這下它真成活菩薩了? 在國產開源大模型的賽道上,一顆重磅炸彈再次被引爆。7月27日晚,Kimi K3 模型正式在 Hugging Face 平台上開源,消息一出,半小時內便斬獲了超過4000個贊,成為該平台有史以來最受關注的開源模型之一。這個被業內戲稱為「活菩薩」的舉動,不僅僅是一次簡單的模型開放,更是一場技術自信的全面展示。 ## 開源即焚訣:K3 真正做到了「傾囊相授」 與以往許多開源模型僅提供權重文件不同,Kimi 這次可謂是誠意滿滿。

站內 AI 整理稿

# Kimi K3 正式公佈焚訣,這下它真成活菩薩了? 在國產開源大模型的賽道上,一顆重磅炸彈再次被引爆。7月27日晚,Kimi K3 模型正式在 Hugging Face 平台上開源,消息一出,半小時內便斬獲了超過4000個贊,成為該平台有史以來最受關注的開源模型之一。這個被業內戲稱為「活菩薩」的舉動,不僅僅是一次簡單的模型開放,更是一場技術自信的全面展示。 ## 開源即焚訣:K3 真正做到了「傾囊相授」

與以往許多開源模型僅提供權重文件不同,Kimi 這次可謂是誠意滿滿。除了模型本身的權重文件外,官方還附帶了一份詳細的技術報告,甚至將訓練模型的工具也一併公開。這種「連鍋端」的做法,讓業界不禁將其與 DeepSeek 相提並論,因為後者此前也曾以同樣的透明度震撼了 AI 社區。 從跑分測試來看,K3 的表現幾乎可謂是「一人之下,萬人之上」。在各項基準測試中,它的成績僅次於 Fable 5 和 GPT-5.6 Sol,穩穩佔據世界第三的位置。更難能可貴的是,K3 是 TOP 3 模型中唯一一個可以下載到本地自行運行和微調的模型,並且自帶多模態功能,幾乎沒有明顯短板。 ## 參數之王:2.8T 總參數刷新開源紀錄

在模型規模上,K3 再次證明了「更大就是更好」的鐵律。這次 K3 的模型總參數直接衝到了 2.8T,不僅刷新了開源模型的紀錄,更是在參數體量上碾壓了許多閉源巨頭。 更令人驚嘆的是激活參數的設計。在實際推理時,K3 能夠直接激活 1042 億個參數,這個數字是上一代 K2 的三倍,更是 DeepSeek V4 Pro 的兩倍。要知道,這個激活量甚至已經超過了許多開源模型的總參數規模,足見其架構設計的激進與高效。 ## 架構創新:混合注意力與殘差連接的完美組合

為了駕馭如此龐大的數據量,Kimi 在架構上進行了多項創新,而這些技術細節在技術報告中全部公開,體現了極高的開放度。首先是混合注意力機制。傳統的注意力機制在處理長文本時存在一個致命缺陷:模型每讀一個新詞,就需要與前面所有的 token 進行計算,導致算力開銷呈指數級增長。Kimi 為了解決這個問題,推出了 Kimi Delta Attention(KDA)。這個機制會一邊讀取文本,一邊將關鍵信息寫入一個持續更新的狀態中,同時判斷哪些舊信息需要保留、哪些可以遺忘。

為了防止 KDA 漏掉關鍵信息,Kimi 還在每三層 KDA 後設置了一個 Gated MLA,相當於讓模型在做完幾頁「筆記」後,再回頭翻閱原文進行核對。通過這套組合拳,K3 極大地降低了超長上下文場景下的計算成本。此外,K3 還引入了 Attention Residuals(注意力殘差連接),有效減少了信息在傳遞過程中的丟失。同時,設計了 Stable LatentMoE,將原本 7168 維的信息先壓縮至 3584 維,再分配給 16 個專家進行處理。為了避免有些專家「加班加點」、有些專家「渾水摸魚」的情況,K3 還為這些專家設計了限流和排班機制,確保負載均衡。

## 效率飛躍:訓練效率提升 2.5 倍

透過這些架構、數據與訓練方法的全面升級,K3 在總參數大幅增加的同時,模型的訓練效率反而比上一代 K2 提升了 2.5 倍。這在 AI 領域可謂是一個奇蹟,證明了架構創新的價值遠超單純的算力堆砌。 ## 地緣政治風暴:開源引發的連鎖反應

K3 的發布與開源,已經遠遠超出了技術圈的範疇,引發了一系列連鎖反應。美國一些政客迅速跳出來指控 K3 是「蒸餾」美國大模型的結果。對此,Kimi 的員工以反諷回應:「Fable 才發布沒多久,Kimi 幾十天的時間就蒸餾出一個模型?那恐怕能申請吉尼斯世界紀錄了。難道中國人有超能力,能蒸餾 Anthropic 未來還沒發布的模型?」

不僅如此,美國政府近期也計劃對中國的人工智能企業進行制裁調查。而中國商務部迅速給出了強有力的反制措施。在這樣的緊張氣氛下,NVIDIA 創始人黃仁勳罕見地註冊了 X 帳號,發表公開信闡述開源的重要性,並拉攏了微軟、谷歌、OpenAI 等近 100 家科技巨頭聯名,公開反對封禁中國的開源模型。 面對壓力,向來主張閉源的 Anthropic 再次發布小作文,聲稱「不抵制開源,只是怕強大模型落在壞人手裡」。這種反覆的態度,業界早已見怪不怪。 ## 開源閉源的賽跑:追趕者終於不再掉隊

回顧 AI 發展史,開源模型與閉源模型之間一直存在著一場不對等的賽跑。閉源巨頭可以隨意學習開源模型的技術——例如 DeepSeek 曾經手把手教會了整個行業如何讓模型學會推理思考,但開源模型卻無法從閉源模型那裡學到什麼。然而,開源社區內部卻存在著良好的互助氛圍。翻開 K3 的論文就會發現,從多頭注意力 MLA、混合專家模型 MoE,到訓練穩定性和推理效率,許多技術中都能看到 DeepSeek 的影子。但 Kimi 沒有簡單照抄,而是在這些基礎上繼續做出了 KDA、Gated MLA、AttnRes 和 Stable LatentMoE 等一系列創新。

開源社區的這種「互相學習、互相致敬」的風氣,正是開源模型最寶貴的財富。上一代模型留下的經驗,會直接變成下一代模型的起點。開源模型們就這樣互相借力,一層一層往上搭,硬生生追上了那些擁有更多算力、資金和數據的閉源巨頭。## 結語:技術平權的新時代

K3 的發布,讓「開源模型會越來越落後」的論調徹底成為過去式。AI 的發展,早已不僅僅是公司與公司、開源與閉源之間的技術競賽,而是與國家安全、地緣政治息息相關的戰略博弈。 從某種意義上說,講道理固然有用,但在國際競爭的舞臺上,擺出實力往往更好使。Kimi K3 的開源,不僅是一次技術的分享,更是對全球開源社區的一次強力注資。當一個又一個像 K3 這樣的優秀模型出現在中國,開源精神的光芒將照亮整個 AI 領域,推動技術向著更普惠、更開放的方向發展。 對於整個行業來說,K3 不僅僅是一個模型,更是一種信念:在這個技術日新月異的時代,真正偉大的進步,終究屬於那些願意分享的人。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

3 小時前