誰在訓練 Kimi K3 ? 深挖貢獻者名單,這有一份最全檔案
重點摘要
起底 K3 背後核心極客天團,人均扛起 7 億估值! 作者丨高允毅 樊天驕 編輯丨馬曉寧 7 月 27 日,月之暗面拿出全部誠意,直接把滿血版 2.8T 模型 Kimi K3 全部開源了。在技術報告的最後,他們首次公佈了Kimi K3背後的實際貢獻者名單,我們細數了一下,有401位成員,可以說,這是月之暗麵人才團隊的一次全面亮相。
月之暗面於七月二十七日正式開源備受矚目的滿血版 2.8T 模型 Kimi K3,並在技術報告尾聲罕見公開了背後的實際貢獻者名單。這份名單涵蓋整整 401 位成員,堪稱月之暗面創立以來最完整的人才實力總體檢。從早期估值僅數億美元的初創公司,到如今被外界譽為「國產大模型之光」,月之暗面已經站上全球人工智慧競技場,成為少數能與 Claude Fable 5、GPT-5.6 Sol 等頂尖模型直接較量的極客團隊。 伴隨 K3 問世,月之暗面的市場估值一舉攀升至 315 億美元,相當於 2100 億元人民幣。令人驚嘆的是,撐起這般天價估值的並不是一支資歷深厚的豪華軍團,而是極度年輕的團隊。根據公開資訊,月之暗面員工總數約三百多人,平均年齡不到三十歲,其中高達八成屬於 I 人性格。若將 2100 億元估值除以團隊人數,幾乎等於人均扛起 7 億元人民幣的市場身價,這樣的數字在整個科技業界都相當罕見。 月之暗面的組織運作方式與傳統科技大廠截然不同。公司由五位創辦人共同領導,每位創辦人平均直接對接四十至五十名成員,內部標榜「無職級、無KPI、無部門牆」,任何員工都可以隨時挑戰老闆的決策。一個廣為流傳的細節是,在 2025 年初的內部反思會上,有員工提出相當激進的建議,執行長楊植麟聽完之後非但沒有退縮,反而採取比建議更激進的做法,直接放棄 K1 路線轉而投入 K2 研發。這種不拘一格的性格也深深烙印在公司的靈魂之中。 身為搖滾樂愛好者的楊植麟,將這份音樂熱情融入辦公空間的每個角落。會議室分別以 Rolling Stones、Nirvana、Radiohead 等傳奇樂隊命名,就連 Kimi 的會員套餐都借用 Adagio(柔板)、Allegro(快板)等音樂術語來命名。在月之暗面的信念中,當算力與數據日益同質化,「品味」才是建立差異化壁壘的核心驅動力。這份品味不僅體現在模型打磨的細膩程度上,更深刻反映在他們對人才的挑剔與渴望。據了解,月之暗面特別喜歡僱用具有創業者光環或賭徒基因的人,內部至少有五十人曾經創辦或加入過創業公司,過去一年透過內部推薦管道加入的新人更超過一百位。 在 K3 貢獻者名單中,位居技術體系頂層基石的核心人物備受矚目。聯合創始人兼演算法團隊負責人周昕宇是楊植麟的舊識,兩人在清華時期曾同屬 Splay 樂隊,周昕宇擔任吉他手,鼓手正是楊植麟。加入月之暗面之前,周昕宇曾在曠視科技從事演算法量產與行動端模型研究,與時任曠視基礎科研負責人、現任階躍星辰首席科學家的張祥雨密切合作,以核心作者身分寫出輕量化網路代表作 ShuffleNet。他主攻大模型演算法量產化,擅長將實驗室最前沿的演算法高效率、低成本地轉化為大規模生產線系統,並在 Reddit 社群的技術交流中率先拆解 Kimi K3 的 KDA 混合架構結合 NoPE MLA 的對比優勢。 另一位聯合創始人吳育昕同樣堪稱人工智慧領域的頂尖明星架構師。他與楊植麟擁有相同的教育軌跡,本科畢業於清華大學計算機系,隨後赴美國卡內基梅隆大學深造,曾在 Meta AI 研究實驗室擔任研究工程師。吳育昕在深度學習與電腦視覺領域留下兩項行業標準級成果:一是作為 Detectron2 的主要創建者之一,該項目重塑了全球電腦視覺研究生態,成為數以萬計視覺大模型與物件偵測項目的通用底座;二是 2018 年與頂尖學者何愷明共同發表 Group Normalization 論文,一舉拿下 ECCV 最佳論文榮譽提名,這項研究打破了傳統 Batch Normalization 在小樣本訓練下的致命瓶頸。他同時也是深度學習里程碑之作 MoCo v1 的核心作者之一,在月之暗面負責深度學習系統優化,讓 Kimi 在萬億參數規模下跑得更穩、算得更快、記憶體吃得更少。 共同創辦人暨技術長張宇韜與楊植麟同為清華師兄弟,智譜創始人唐傑是他的老師。他早在 2016 年就與楊植麟共同創立「循環智能」,之後再度聯手打造月之暗面。張宇韜最為人知的技術標籤是主導科技大數據分析平台 AMiner 的研發,這套平台背後核心的異構數據融合技術,正是他在清華攻讀博士期間參與構建的底層能力。他曾在 KDD、CIKM 等頂尖會議發表多篇高引論文,並在循環智能時期主導開發「千循零樣本 AI 平台」。他對 AI 從「能對話」走向「能幹活」的每個節點都有精準預判,在近期技術峰會上梳理了行業工程化的三段脈絡:2023 年是研究「怎麼問」的 Prompt 時代,2024 年演進到「給足信息」的 Context 時代,2026 年則正式步入 Harness 工程新階段——也就是如何構建運行環境、讓 AI 出了問題能自己閉環修改。 工程副總裁兼 AI 基礎設施負責人許欣然具備全棧底層開發經驗,曾在曠視負責 MegEngine 深度學習框架與億級向量檢索系統研發。他目前主掌月之暗面大模型訓練、推理與基礎設施的整體架構,最具代表性的成果是與團隊聯合設計以 KV Cache 為中心的分離式推理架構 Mooncake,這套系統徹底分離預填充與解碼階段,緩解百萬級超長上下文的顯存與 I/O 壓力,奪下儲存頂級會議 FAST 2025 最佳論文獎。他同時也是 MoBA 混合塊注意力機制的核心作者之一,透過塊級別注意力切分實現大幅降本增效,並參與開源項目 Moonlight 及其底層優化器 Muon 的研發,以矩陣正交化處理取代傳統 AdamW,有效降低萬億參數模型在分佈式訓練中的算力成本。 推理系統負責人何蔚然同樣是 FAST 2025 最佳論文的核心作者,從 Kimi k1.5、Kimi-VL、K2 到 Kimi Linear、Kimi-Audio,再到 MoBA、Muon、AttnRes 等核心架構論文,他的署名貫穿六代技術成果。何蔚然畢業於清華大學計算機系,早年深耕晶片佈線與底層性能優化,曠視時期主力攻堅自研 AI 晶片與低位寬神經網絡,與周昕宇同期共事。他最具代表性的 Mooncake 架構打破傳統推理服務的架構定式,將大模型最耗顯存的記憶緩存拆解出來集中調度,透過全局緩存複用和精細化路由,在算力規模不變的前提下讓 Kimi 請求承載量提升超過 75%。他在 2024 年 QCon 大會上披露,依託這套架構,Kimi 推理集群的單位成本一年下降超過 20 倍。最終 K3 交出的成績單是推理成本僅為 Claude Fable 5 的 38%,這背後與 Mooncake 體系的核心命題息息相關。 在中堅攻堅層級,負責預訓練與規模化方向的杜羽倫畢業於伊利諾大學香檳分校和卡內基梅隆大學人工智慧專業,曾在循環智能歷任研究員、AI Lab 負責人,是月之暗面核心技術元老。他的技術貢獻完整貫穿 Kimi 歷代核心旗艦基座以及 VL、Audio 等多模態全系列架構設計,是《Attention Residuals》、《MoBA》以及優化器論文《Muon is Scalable for LLM Training》的共同作者。核心架構師張宇則主攻大語言模型的高效、可擴展與硬體友好型架構設計,作為非 Transformer 與線性注意力路線的開拓者,他主導開源的 Kimi Linear 模型首次將線性注意力機制成功應用於超長上下文任務,並從根本上解決大模型中 PreNorm 導致的梯度稀釋與隱狀態爆炸問題。 賴國堃是楊植麟的清華兼卡內基梅隆大學雙重校友,也是 Kimi 團隊論文數量最多的研究者之一。他在加入月之暗面之前已留下兩項定義級成果:一是打造全球最大的機器閱讀理解數據集 RACE,直接用中國學生英語考試題訓練 AI,成為全球機器閱讀理解的標尺;二是他在本科時期寫的推薦演算法論文,在十年後的 2024 年拿下 SIGIR 時間檢驗獎,這是信息檢索領域的最高榮譽之一。團隊中還有一位令人矚目的少年陳廣宇,2009 年出生、年僅 17 歲,曾讓馬斯克在 X 平台上公開驚嘆「Impressive」。他與蘇劍林等人並列為 Kimi K3 核心架構奠基作《Attention Residuals》的共同第一作者,這套機制直接對深度學習領域沿用了近十年的標準殘差連接動刀,用「可學習的深度注意力」讓模型能夠聰明地「回頭看」,將擴展效率拉高 1.25 倍。他加入月之暗面的過程也充滿傳奇色彩,一年前甚至不知道什麼是 Transformer,因在一場黑客松中想出「人類第三隻機械輔助手」構想而被矽谷新創挖掘,七週後被 Kimi 團隊破格接入核心研究組,入職第一週就拿下內部 48 小時極限黑客馬拉松總冠軍。 杜昂昂是 Kimi 技術報告中少有的五代全勤研究者,兩度拿下團隊署名後的第一順位,是月之暗面多模態體系的核心骨幹。他本碩七年就讀於中國海洋大學水下視覺實驗室,2020 年以第一作者身分在 Global OCEANS 發表浮游生物顯微圖像分類研究,之後在曠視科技參與的多人姿態估計研究被 ECCV 2020 收錄,論文累計引用超過 300 次。進入 Kimi 後他深耕視覺編碼器設計、多模態對齊與視覺智能體技術,2025 年以第一作者發布 Kimi-VL 開源多模態模型,自研 MoonViT 視覺編碼器原生支持超高解析度輸入,搭配 128K 長上下文能力,奠定 Kimi 全系多模態能力的技術底座。後訓練團隊的瞿博文本科畢業於華中科技大學、碩士畢業於北京大學電子學院,主攻多模態強化學習、視覺語言模型、AI 智能體與 AIGC 內容品質評估,深度參與 Kimi-K2.5 項目並投入原生多模態強化學習研發。郭海清則是團隊元老級成員,全程參與 Kimi 多代核心項目研發迭代,公開可核實的參與項目涵蓋 k1.5、K2、K3 三代旗艦技術報告以及注意力殘差核心架構論文。 這份 401 人名單的完整揭露,讓外界得以窺見月之暗面背後真實的技術底蘊。從頂層架構設計到底層工程落地,從多模態視覺到長文本推理,這支平均年齡不到三十歲的極客軍團,正以一種極度扁平卻異常高效的方式,改寫著中國大模型在全球牌桌上的位置。
Related
相關文章
Google Earth推出基於Nano Banana 2的全新圖像生成功能 一鍵生成逼真AI場景與歷史風貌
AI資訊AI新閒資訊正文Google Earth推出基於Nano Banana 2的全新圖像生成功能 一鍵生成逼真AI場景與歷史風貌發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘在人工智能技術加速賦能日常工具的背景下,Google Earth(谷歌地球)近日正式推出了基於Nano Banana2模型的全新圖像生成功能。通過將衛星、航空與3D實景地圖同生成式AI深度融合,該功能允許全球網頁端用戶直接在地圖上對現實地點進行視覺重塑。作為該功能的亮點,用戶只需在網頁版谷歌地球中放大至特定目標區域,點擊“創建 image”並輸入描述性指令,即可基於真實地理數據生成深度契合實際地形的定製圖像。這一技術不僅拓展了空間可視化的邊界,也為多個行業應用場景提供了全新解法。在教育領域,該功能使歷史教學擺脫了純文字的抽象感。教師帶領學生觀察世界遺產時,輸入諸如渲染公元78年龐貝古城繁華街景的指令,廢墟便能一鍵復原為充滿羅馬帝國風貌的立體場景。同時,結合 Gemini 的底層檢索能力,系統還能夠圍繞地標建築快速生成包含關鍵歷史因果的直觀信息圖。對於房地產開發與城市規劃行業,這項技術顯著降低了前期概念演示的門檻。無論是向客戶展示東京空置地塊改造為商業綜合體的未來願景,還是為買家模擬依山傍水的現代湖畔木屋,規劃者只需輸入具體需求,系統便能在原有自然地貌上實時渲染出具備高精度的3D設計效果,幫助團隊在動工前更直觀地評估方案。此外,該工具也為大眾提供了打破現實邊界的趣味體驗。用戶可以將谷歌的山景城園區一鍵轉化為充滿賽博朋克風格的科幻烏託邦,直觀感受百年後的視覺奇觀。目前,該功能已面向全球網頁端用戶正式上線。相關推薦告別盲目像素預測:PhiZero開創“物理語言”先河,讓AI世界模型學會像人一樣思考PhiZero物理世界模型革新視頻生成,破解像素預測的物理偏差。它首創“物理語言”,讓AI顯
告別盲目像素預測:PhiZero開創“物理語言”先河,讓AI世界模型學會像人一樣思考
AI資訊AI新閒資訊正文告別盲目像素預測:PhiZero開創“物理語言”先河,讓AI世界模型學會像人一樣思考發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘在當前的大模型浪潮中,視頻生成模型常常被視為通往具身智能的未來模擬器。然而,主流模型多采用像素空間的直接預測,容易在物理規律的穩定性和連貫性上出現偏差。針對這一行業痛點,研究團隊近日正式推出了全新的物理世界模型PhiZero。該模型摒棄了傳統的盲目預測套路,創新性地引入了“物理語言”概念,讓AI在生成視頻前先進行顯式的物理推理。作為核心創新,PhiZero提出了一種被稱為“物理語言”的離散表徵。該語言通過自監督學習方式,從海量野外視頻中提煉出狀態轉移模式,捕捉不同視覺經驗裡的動態演化規律。在此基礎上,模型構建了“先推理、後渲染”的創新架構:系統首先在物理語言空間內自迴歸地推斷未來世界的演變軌跡,隨後交由專用的擴散解碼器將其渲染為高清視頻。這種設計不僅將底層動力學推演與像素級合成分離開來,還大幅提升了模型在物理一致性上的表現。在技術實現上,該系統分為分詞器與推理器兩大核心模塊。其中,物理語言分詞器利用轉移級 Q-Former 捕獲相鄰狀態變化,並結合有限標量量化機制生成緊湊的離散符號;擴散解碼器則以首幀和離散符號為條件,恢復出細膩的視覺細節。而物理語言推理器則基於預訓練視覺語言模型進行初始化,從首幀和文本動作意圖出發,精準預測未來的物理語言序列。多項基準測試結果表明,PhiZero在 Physics-IQ Verified、PhyGround 以及 WorldModelBench 等多個物理推理和視頻生成評估中取得了領先成績。無論是碰撞引起的物體位移、重力驅動的形變,還是複雜的連鎖反應,模型均能展現出高度逼真的物理合理性。隨著具身智能與機器人技術的加速落地,PhiZero的問世為可控、可交互的世界建模開闢了
字節跳動 Seedance 2.5 發佈:30 秒一鏡到底,AI 視頻開始會講故事了
字節跳動正式推出 Seedance 2.5 影片生成模型,單次生成時長從 15 秒翻倍至 30 秒,並能多輪延長且維持人物、場景與風格一致。該模型強化長敘事與多模態參考能力,支援單次輸入最多 30 張圖片、10 段影片與 10 段音頻,可同時還原多人形象與聲音。Seedance 2.5 將陸續上線即夢 AI 與豆包專業版,API 也將接入火山方舟,鎖定影視、廣告、教育等多元場景。
阿里千問發佈Qwen-Audio-3.0-ASR-Flash,語音識別攻克專業場景"最後一公里"
阿里通義千問發布語音識別大模型Qwen-Audio-3.0-ASR-Flash,主打長音頻上下文記憶與內建多行業詞庫,醫療、IT等專業術語無需配置即可精準識別。該模型支援30餘種語言,並整合語音潤色功能,已在阿里雲百鍊平台開放調用。同步推出的Streaming版本鎖定即時場景,延遲僅300毫秒,系列先前於評測拿下全球第一。
PolyAI Releases Dialog-RSN-1: An Audio-Native Dialog Model That Fuses Turn-Taking, Speech Recognition, Function Calling, And Response
PolyAI has introduced Dialog-RSN-1, a dialog model that perceives the caller’s audio directly instead of reading a transcript.
蘋果暗示Siri AI將引入付費限制,重度用戶或需訂閱iCloud+
蘋果在庫克最後一次財報電話會議上暗示,Siri AI未來可能採用付費模式,高頻使用的重度用戶或需訂閱iCloud+服務。蘋果計劃為Siri AI免費使用設定額度,超出限制將收費,但目前具體標準尚未公布。此外,部分Apple Intelligence功能也已規劃分級策略,iCloud+訂閱用戶可獲得更高使用額度。