Kimi K3 正式公佈焚訣,這下它真成活菩薩了?

重點摘要
# Kimi K3 正式公佈焚訣,這下它真成活菩薩了? 在國產開源大模型的賽道上,一顆重磅炸彈再次被引爆。7月27日晚,Kimi K3 模型正式在 Hugging Face 平台上開源,消息一出,半小時內便斬獲了超過4000個贊,成為該平台有史以來最受關注的開源模型之一。這個被業內戲稱為「活菩薩」的舉動,不僅僅是一次簡單的模型開放,更是一場技術自信的全面展示。 ## 開源即焚訣:K3 真正做到了「傾囊相授」 與以往許多開源模型僅提供權重文件不同,Kimi 這次可謂是誠意滿滿。
# Kimi K3 正式公佈焚訣,這下它真成活菩薩了? 在國產開源大模型的賽道上,一顆重磅炸彈再次被引爆。7月27日晚,Kimi K3 模型正式在 Hugging Face 平台上開源,消息一出,半小時內便斬獲了超過4000個贊,成為該平台有史以來最受關注的開源模型之一。這個被業內戲稱為「活菩薩」的舉動,不僅僅是一次簡單的模型開放,更是一場技術自信的全面展示。 ## 開源即焚訣:K3 真正做到了「傾囊相授」
與以往許多開源模型僅提供權重文件不同,Kimi 這次可謂是誠意滿滿。除了模型本身的權重文件外,官方還附帶了一份詳細的技術報告,甚至將訓練模型的工具也一併公開。這種「連鍋端」的做法,讓業界不禁將其與 DeepSeek 相提並論,因為後者此前也曾以同樣的透明度震撼了 AI 社區。 從跑分測試來看,K3 的表現幾乎可謂是「一人之下,萬人之上」。在各項基準測試中,它的成績僅次於 Fable 5 和 GPT-5.6 Sol,穩穩佔據世界第三的位置。更難能可貴的是,K3 是 TOP 3 模型中唯一一個可以下載到本地自行運行和微調的模型,並且自帶多模態功能,幾乎沒有明顯短板。 ## 參數之王:2.8T 總參數刷新開源紀錄
在模型規模上,K3 再次證明了「更大就是更好」的鐵律。這次 K3 的模型總參數直接衝到了 2.8T,不僅刷新了開源模型的紀錄,更是在參數體量上碾壓了許多閉源巨頭。 更令人驚嘆的是激活參數的設計。在實際推理時,K3 能夠直接激活 1042 億個參數,這個數字是上一代 K2 的三倍,更是 DeepSeek V4 Pro 的兩倍。要知道,這個激活量甚至已經超過了許多開源模型的總參數規模,足見其架構設計的激進與高效。 ## 架構創新:混合注意力與殘差連接的完美組合
為了駕馭如此龐大的數據量,Kimi 在架構上進行了多項創新,而這些技術細節在技術報告中全部公開,體現了極高的開放度。 首先是混合注意力機制。傳統的注意力機制在處理長文本時存在一個致命缺陷:模型每讀一個新詞,就需要與前面所有的 token 進行計算,導致算力開銷呈指數級增長。Kimi 為了解決這個問題,推出了 Kimi Delta Attention(KDA)。這個機制會一邊讀取文本,一邊將關鍵信息寫入一個持續更新的狀態中,同時判斷哪些舊信息需要保留、哪些可以遺忘。 為了防止 KDA 漏掉關鍵信息,Kimi 還在每三層 KDA 後設置了一個 Gated MLA,相當於讓模型在做完幾頁「筆記」後,再回頭翻閱原文進行核對。通過這套組合拳,K3 極大地降低了超長上下文場景下的計算成本。 此外,K3 還引入了 Attention Residuals(注意力殘差連接),有效減少了信息在傳遞過程中的丟失。同時,設計了 Stable LatentMoE,將原本 7168 維的信息先壓縮至 3584 維,再分配給 16 個專家進行處理。為了避免有些專家「加班加點」、有些專家「渾水摸魚」的情況,K3 還為這些專家設計了限流和排班機制,確保負載均衡。 ## 效率飛躍:訓練效率提升 2.5 倍
透過這些架構、數據與訓練方法的全面升級,K3 在總參數大幅增加的同時,模型的訓練效率反而比上一代 K2 提升了 2.5 倍。這在 AI 領域可謂是一個奇蹟,證明了架構創新的價值遠超單純的算力堆砌。 ## 地緣政治風暴:開源引發的連鎖反應
K3 的發布與開源,已經遠遠超出了技術圈的範疇,引發了一系列連鎖反應。美國一些政客迅速跳出來指控 K3 是「蒸餾」美國大模型的結果。對此,Kimi 的員工以反諷回應:「Fable 才發布沒多久,Kimi 幾十天的時間就蒸餾出一個模型?那恐怕能申請吉尼斯世界紀錄了。難道中國人有超能力,能蒸餾 Anthropic 未來還沒發布的模型?」
不僅如此,美國政府近期也計劃對中國的人工智能企業進行制裁調查。而中國商務部迅速給出了強有力的反制措施。在這樣的緊張氣氛下,NVIDIA 創始人黃仁勳罕見地註冊了 X 帳號,發表公開信闡述開源的重要性,並拉攏了微軟、谷歌、OpenAI 等近 100 家科技巨頭聯名,公開反對封禁中國的開源模型。 面對壓力,向來主張閉源的 Anthropic 再次發布小作文,聲稱「不抵制開源,只是怕強大模型落在壞人手裡」。這種反覆的態度,業界早已見怪不怪。 ## 開源閉源的賽跑:追趕者終於不再掉隊
回顧 AI 發展史,開源模型與閉源模型之間一直存在著一場不對等的賽跑。閉源巨頭可以隨意學習開源模型的技術——例如 DeepSeek 曾經手把手教會了整個行業如何讓模型學會推理思考,但開源模型卻無法從閉源模型那裡學到什麼。 然而,開源社區內部卻存在著良好的互助氛圍。翻開 K3 的論文就會發現,從多頭注意力 MLA、混合專家模型 MoE,到訓練穩定性和推理效率,許多技術中都能看到 DeepSeek 的影子。但 Kimi 沒有簡單照抄,而是在這些基礎上繼續做出了 KDA、Gated MLA、AttnRes 和 Stable LatentMoE 等一系列創新。 開源社區的這種「互相學習、互相致敬」的風氣,正是開源模型最寶貴的財富。上一代模型留下的經驗,會直接變成下一代模型的起點。開源模型們就這樣互相借力,一層一層往上搭,硬生生追上了那些擁有更多算力、資金和數據的閉源巨頭。 ## 結語:技術平權的新時代
K3 的發布,讓「開源模型會越來越落後」的論調徹底成為過去式。AI 的發展,早已不僅僅是公司與公司、開源與閉源之間的技術競賽,而是與國家安全、地緣政治息息相關的戰略博弈。 從某種意義上說,講道理固然有用,但在國際競爭的舞臺上,擺出實力往往更好使。Kimi K3 的開源,不僅是一次技術的分享,更是對全球開源社區的一次強力注資。當一個又一個像 K3 這樣的優秀模型出現在中國,開源精神的光芒將照亮整個 AI 領域,推動技術向著更普惠、更開放的方向發展。 對於整個行業來說,K3 不僅僅是一個模型,更是一種信念:在這個技術日新月異的時代,真正偉大的進步,終究屬於那些願意分享的人。
Related
相關文章

阿里雲 Qoder 開源 Better Harness,面向編程 Agent 的分析與持續改進工具
首頁 > 智能時代>人工智能 阿里雲 Qoder 開源 Better Harness,面向編程 Agent 的分析與持續改進工具 2026/7/29 9:56:31 來源:IT之家 作者:故淵 責編:故淵 評論: 感謝IT之家網友 Domado 的線索投遞!

柔性觸覺感知企業獲新一輪融資,預計2026年公司營收翻10倍|硬氪首發
好的,這是根據您提供的來源資料,重新整理並撰寫的一篇完整新聞稿。 --- ### 標題:破解具身智能數據饑渴,柔性觸覺感知企業「堯樂科技」獲Pre-A+輪融資,預估2026年營收暴漲10倍 **導語:** 隨著人形機器人硬件工程逐漸成熟,觸覺數據的結構性短缺已成為制約產業發展的關鍵瓶頸。專注於柔性織物傳感技術的「堯樂科技」近日完成Pre-A+輪融資,其獨創的「織物即傳感器」數據手套方案,旨在為具身智能、世界模型等前沿領域提供高質量的真實物理交互數據,填補市場巨大缺口。

當它們選擇放棄全自研,能否上全球新牌桌?
好的,這是一篇根據您提供的資料重寫的完整新聞稿。 --- ### **放棄全自研,擁抱AI巨頭:日本機器人產業能否重返全球牌桌?** 過去兩年,全球具身智能(Embodied AI)與人形機器人賽道風起雲湧,融資紀錄在中美之間輪流刷新,兩國的機器人正快速從實驗室走進工廠、踏上發表會舞台。在這場席捲全球的科技浪潮中,業界普遍認為,真正的競爭者只有中美兩國。然而,一個曾經定義了「機器人」一詞的國家——日本,卻在很長一段時間內顯得異常沉默。

從吳啟華到王祖賢,明星為什麼願意把臉“賣”給AI?
王祖賢近日授權其年輕肖像給網易遊戲《天下》,利用AI復刻經典角色,成為明星AI肖像商用授權的新案例。吳啟華也將年輕肖像授權給AI電影,顯示老牌明星正透過AI將經典形象轉化為可持續開發的數位資產。此模式雖有市場需求,但法律與授權邊界問題仍待解決,現階段僅適用於淡出螢幕的經典明星。

承認掉隊後換牌:亞馬遜AI擱置Nova旗艦、押注FMR
承認掉隊後換牌:亞馬遜AI擱置Nova旗艦、押注FMR硅谷Tech news2026.07.29 08:34 · 來自江蘇全文1868字00:00 / 05:08FMR的目標是開發一款全新的旗艦基礎模型,預計在2026年秋季的AWS re:Invent大會上正式亮相。“在最大規模、最高要求的工作負載上,還沒有站在最前沿。
