雷峰網生成式AI

誰在訓練 Kimi K3 ? 深挖貢獻者名單,這有一份最全檔案

2026年7月31日 02:38

重點摘要

起底 K3 背後核心極客天團,人均扛起 7 億估值! 作者丨高允毅 樊天驕 編輯丨馬曉寧 7 月 27 日,月之暗面拿出全部誠意,直接把滿血版 2.8T 模型 Kimi K3 全部開源了。在技術報告的最後,他們首次公佈了Kimi K3背後的實際貢獻者名單,我們細數了一下,有401位成員,可以說,這是月之暗麵人才團隊的一次全面亮相。

站內 AI 整理稿

月之暗面於七月二十七日正式開源備受矚目的滿血版 2.8T 模型 Kimi K3,並在技術報告尾聲罕見公開了背後的實際貢獻者名單。這份名單涵蓋整整 401 位成員,堪稱月之暗面創立以來最完整的人才實力總體檢。從早期估值僅數億美元的初創公司,到如今被外界譽為「國產大模型之光」,月之暗面已經站上全球人工智慧競技場,成為少數能與 Claude Fable 5、GPT-5.6 Sol 等頂尖模型直接較量的極客團隊。伴隨 K3 問世,月之暗面的市場估值一舉攀升至 315 億美元,相當於 2100 億元人民幣。令人驚嘆的是,撐起這般天價估值的並不是一支資歷深厚的豪華軍團,而是極度年輕的團隊。

根據公開資訊,月之暗面員工總數約三百多人,平均年齡不到三十歲,其中高達八成屬於 I 人性格。若將 2100 億元估值除以團隊人數,幾乎等於人均扛起 7 億元人民幣的市場身價,這樣的數字在整個科技業界都相當罕見。月之暗面的組織運作方式與傳統科技大廠截然不同。公司由五位創辦人共同領導,每位創辦人平均直接對接四十至五十名成員,內部標榜「無職級、無KPI、無部門牆」,任何員工都可以隨時挑戰老闆的決策。一個廣為流傳的細節是,在 2025 年初的內部反思會上,有員工提出相當激進的建議,執行長楊植麟聽完之後非但沒有退縮,反而採取比建議更激進的做法,直接放棄 K1 路線轉而投入 K2 研發。

這種不拘一格的性格也深深烙印在公司的靈魂之中。身為搖滾樂愛好者的楊植麟,將這份音樂熱情融入辦公空間的每個角落。會議室分別以 Rolling Stones、Nirvana、Radiohead 等傳奇樂隊命名,就連 Kimi 的會員套餐都借用 Adagio(柔板)、Allegro(快板)等音樂術語來命名。在月之暗面的信念中,當算力與數據日益同質化,「品味」才是建立差異化壁壘的核心驅動力。這份品味不僅體現在模型打磨的細膩程度上,更深刻反映在他們對人才的挑剔與渴望。

據了解,月之暗面特別喜歡僱用具有創業者光環或賭徒基因的人,內部至少有五十人曾經創辦或加入過創業公司,過去一年透過內部推薦管道加入的新人更超過一百位。在 K3 貢獻者名單中,位居技術體系頂層基石的核心人物備受矚目。聯合創始人兼演算法團隊負責人周昕宇是楊植麟的舊識,兩人在清華時期曾同屬 Splay 樂隊,周昕宇擔任吉他手,鼓手正是楊植麟。加入月之暗面之前,周昕宇曾在曠視科技從事演算法量產與行動端模型研究,與時任曠視基礎科研負責人、現任階躍星辰首席科學家的張祥雨密切合作,以核心作者身分寫出輕量化網路代表作 ShuffleNet。

他主攻大模型演算法量產化,擅長將實驗室最前沿的演算法高效率、低成本地轉化為大規模生產線系統,並在 Reddit 社群的技術交流中率先拆解 Kimi K3 的 KDA 混合架構結合 NoPE MLA 的對比優勢。另一位聯合創始人吳育昕同樣堪稱人工智慧領域的頂尖明星架構師。他與楊植麟擁有相同的教育軌跡,本科畢業於清華大學計算機系,隨後赴美國卡內基梅隆大學深造,曾在 Meta AI 研究實驗室擔任研究工程師。

吳育昕在深度學習與電腦視覺領域留下兩項行業標準級成果:一是作為 Detectron2 的主要創建者之一,該項目重塑了全球電腦視覺研究生態,成為數以萬計視覺大模型與物件偵測項目的通用底座;二是 2018 年與頂尖學者何愷明共同發表 Group Normalization 論文,一舉拿下 ECCV 最佳論文榮譽提名,這項研究打破了傳統 Batch Normalization 在小樣本訓練下的致命瓶頸。他同時也是深度學習里程碑之作 MoCo v1 的核心作者之一,在月之暗面負責深度學習系統優化,讓 Kimi 在萬億參數規模下跑得更穩、算得更快、記憶體吃得更少。

共同創辦人暨技術長張宇韜與楊植麟同為清華師兄弟,智譜創始人唐傑是他的老師。他早在 2016 年就與楊植麟共同創立「循環智能」,之後再度聯手打造月之暗面。張宇韜最為人知的技術標籤是主導科技大數據分析平台 AMiner 的研發,這套平台背後核心的異構數據融合技術,正是他在清華攻讀博士期間參與構建的底層能力。他曾在 KDD、CIKM 等頂尖會議發表多篇高引論文,並在循環智能時期主導開發「千循零樣本 AI 平台」。

他對 AI 從「能對話」走向「能幹活」的每個節點都有精準預判,在近期技術峰會上梳理了行業工程化的三段脈絡:2023 年是研究「怎麼問」的 Prompt 時代,2024 年演進到「給足信息」的 Context 時代,2026 年則正式步入 Harness 工程新階段——也就是如何構建運行環境、讓 AI 出了問題能自己閉環修改。工程副總裁兼 AI 基礎設施負責人許欣然具備全棧底層開發經驗,曾在曠視負責 MegEngine 深度學習框架與億級向量檢索系統研發。

他目前主掌月之暗面大模型訓練、推理與基礎設施的整體架構,最具代表性的成果是與團隊聯合設計以 KV Cache 為中心的分離式推理架構 Mooncake,這套系統徹底分離預填充與解碼階段,緩解百萬級超長上下文的顯存與 I/O 壓力,奪下儲存頂級會議 FAST 2025 最佳論文獎。他同時也是 MoBA 混合塊注意力機制的核心作者之一,透過塊級別注意力切分實現大幅降本增效,並參與開源項目 Moonlight 及其底層優化器 Muon 的研發,以矩陣正交化處理取代傳統 AdamW,有效降低萬億參數模型在分佈式訓練中的算力成本。

推理系統負責人何蔚然同樣是 FAST 2025 最佳論文的核心作者,從 Kimi k1.5、Kimi-VL、K2 到 Kimi Linear、Kimi-Audio,再到 MoBA、Muon、AttnRes 等核心架構論文,他的署名貫穿六代技術成果。何蔚然畢業於清華大學計算機系,早年深耕晶片佈線與底層性能優化,曠視時期主力攻堅自研 AI 晶片與低位寬神經網絡,與周昕宇同期共事。他最具代表性的 Mooncake 架構打破傳統推理服務的架構定式,將大模型最耗顯存的記憶緩存拆解出來集中調度,透過全局緩存複用和精細化路由,在算力規模不變的前提下讓 Kimi 請求承載量提升超過 75%。

他在 2024 年 QCon 大會上披露,依託這套架構,Kimi 推理集群的單位成本一年下降超過 20 倍。最終 K3 交出的成績單是推理成本僅為 Claude Fable 5 的 38%,這背後與 Mooncake 體系的核心命題息息相關。在中堅攻堅層級,負責預訓練與規模化方向的杜羽倫畢業於伊利諾大學香檳分校和卡內基梅隆大學人工智慧專業,曾在循環智能歷任研究員、AI Lab 負責人,是月之暗面核心技術元老。

他的技術貢獻完整貫穿 Kimi 歷代核心旗艦基座以及 VL、Audio 等多模態全系列架構設計,是《Attention Residuals》、《MoBA》以及優化器論文《Muon is Scalable for LLM Training》的共同作者。核心架構師張宇則主攻大語言模型的高效、可擴展與硬體友好型架構設計,作為非 Transformer 與線性注意力路線的開拓者,他主導開源的 Kimi Linear 模型首次將線性注意力機制成功應用於超長上下文任務,並從根本上解決大模型中 PreNorm 導致的梯度稀釋與隱狀態爆炸問題。

賴國堃是楊植麟的清華兼卡內基梅隆大學雙重校友,也是 Kimi 團隊論文數量最多的研究者之一。他在加入月之暗面之前已留下兩項定義級成果:一是打造全球最大的機器閱讀理解數據集 RACE,直接用中國學生英語考試題訓練 AI,成為全球機器閱讀理解的標尺;二是他在本科時期寫的推薦演算法論文,在十年後的 2024 年拿下 SIGIR 時間檢驗獎,這是信息檢索領域的最高榮譽之一。團隊中還有一位令人矚目的少年陳廣宇,2009 年出生、年僅 17 歲,曾讓馬斯克在 X 平台上公開驚嘆「Impressive」。

他與蘇劍林等人並列為 Kimi K3 核心架構奠基作《Attention Residuals》的共同第一作者,這套機制直接對深度學習領域沿用了近十年的標準殘差連接動刀,用「可學習的深度注意力」讓模型能夠聰明地「回頭看」,將擴展效率拉高 1.25 倍。他加入月之暗面的過程也充滿傳奇色彩,一年前甚至不知道什麼是 Transformer,因在一場黑客松中想出「人類第三隻機械輔助手」構想而被矽谷新創挖掘,七週後被 Kimi 團隊破格接入核心研究組,入職第一週就拿下內部 48 小時極限黑客馬拉松總冠軍。

杜昂昂是 Kimi 技術報告中少有的五代全勤研究者,兩度拿下團隊署名後的第一順位,是月之暗面多模態體系的核心骨幹。他本碩七年就讀於中國海洋大學水下視覺實驗室,2020 年以第一作者身分在 Global OCEANS 發表浮游生物顯微圖像分類研究,之後在曠視科技參與的多人姿態估計研究被 ECCV 2020 收錄,論文累計引用超過 300 次。進入 Kimi 後他深耕視覺編碼器設計、多模態對齊與視覺智能體技術,2025 年以第一作者發布 Kimi-VL 開源多模態模型,自研 MoonViT 視覺編碼器原生支持超高解析度輸入,搭配 128K 長上下文能力,奠定 Kimi 全系多模態能力的技術底座。

後訓練團隊的瞿博文本科畢業於華中科技大學、碩士畢業於北京大學電子學院,主攻多模態強化學習、視覺語言模型、AI 智能體與 AIGC 內容品質評估,深度參與 Kimi-K2.5 項目並投入原生多模態強化學習研發。郭海清則是團隊元老級成員,全程參與 Kimi 多代核心項目研發迭代,公開可核實的參與項目涵蓋 k1.5、K2、K3 三代旗艦技術報告以及注意力殘差核心架構論文。這份 401 人名單的完整揭露,讓外界得以窺見月之暗面背後真實的技術底蘊。

從頂層架構設計到底層工程落地,從多模態視覺到長文本推理,這支平均年齡不到三十歲的極客軍團,正以一種極度扁平卻異常高效的方式,改寫著中國大模型在全球牌桌上的位置。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前