鈦媒體生成式AI

Kimi K3開放權重:技術報告能否回應Claude蒸餾質疑?

2026年7月29日 13:43
Kimi K3開放權重:技術報告能否回應Claude蒸餾質疑?

重點摘要

Kimi K3開放權重:技術報告能否回應Claude蒸餾質疑?TechPulse2026.07.29 13:42 · 來自河北全文3096字00:00 / 09:07不管如何,它仍是目前規模最大、能力最接近閉源旗艦的開放權重模型之一。7月27日晚,Kimi K3開放日如約而至。

站內 AI 整理稿

月之暗面於7月27日晚間舉辦Kimi K3開放日,正式對外釋出K3模型權重與技術報告,同時開源三項關鍵基礎設施:用於超大規模MoE通訊的MoonEP、針對線性注意力的FlashKDA,以及支援長週期智能體強化學習的AgentEnv。此舉不僅展示了K3的技術架構,也試圖回應外界對其是否大量蒸餾Anthropic旗下Claude模型能力的質疑。然而,開放權重與技術報告能否完整澄清數據來源,仍有待社群與監管機構進一步檢驗。K3採用混合專家(MoE)架構,總參數達2.8兆,內部配置896個路由專家,每個Token會選取其中16個,同時調用兩個共享專家,實際激活參數約1042億。

相較於前一代Kimi K2(總參數1.04兆、激活參數326億),K3的總容量擴大了近2.7倍,單次計算調用的參數也成長超過兩倍。月之暗面指出,規模增長是能力提升的直接因素,但背後還有更多架構創新。在注意力機制方面,K3以3:1比例混合Kimi Delta Attention與Gated MLA。前者以較低快取成本處理長上下文,後者定期執行全局資訊交互,兩者平衡效率與能力,使原生上下文窗口擴展至約100萬Token。此外,Attention Residuals技術允許模型有選擇性地調用前一網絡區塊的表示,避免深層模型中的資訊稀釋,讓早期重要資訊更直接影響後續計算。

Stable LatentMoE則進一步擴大專家空間,同時只讓少數專家參與每次計算,在增加知識容量的同時,不必讓全部2.8兆參數同時運作。月之暗面稱,K3相較K2實現了約2.5倍的整體擴展效率提升。然而,這些技術並未完全降低複雜度,而是將部分複雜性轉移至底層AI基礎設施(AI Infra)。更多專家意味著更困難的跨卡調度,KDA減少長上下文快取壓力卻引入新的遞迴狀態,Attention Residuals則增加跨層資訊的保存與傳遞。為此,月之暗面同步開放MoonEP與FlashKDA,前者負責平衡超大規模MoE中的專家負載,後者協助KDA更高效運行於GPU。

這意味著K3的效率不僅來自模型權重本身,還強烈依賴Kernel、通訊、快取與集群調度的協同。權重開放後,這套系統已開始接受外部工程驗證,例如昇騰於7月28日宣布對K3進行0day適配,覆蓋訓練、推理、顯存優化及MXFP4等數值格式;vLLM、SGLang與TokenSpeed也已提供運行支援。不過,開放僅一天,社群大多仍處於調試階段,尚未獨立復現其2.5倍擴展效率、百萬Token吞吐與長週期智能體表現。除了基礎架構,K3的後訓練流程或許更能解釋其在程式設計與智能體任務上的顯著躍升。

根據技術報告,月之暗面先透過監督微調建立冷啟動模型,隨後在通用任務、通用智能體與程式設計智能體三個方向進行強化學習,每個方向再分別訓練low、high與max三檔推理強度,共形成九個專業教師策略。最後,這些專業模型透過多教師在線策略蒸餾(MOPD)合併為統一的K3。在線蒸餾的關鍵在於,學生模型並非簡單模仿教師提前生成的答案,而是先依自身策略生成任務軌跡,再由對應領域與推理強度的教師提供反饋,這更接近學生模型實際遇到的狀態,也更容易將九套不同策略整合進一個模型。值得注意的是,技術報告中的MOPD與美國方面指控的Claude蒸餾並非同一件事。

報告披露的MOPD階段,直接教師是九個由K3冷啟動模型經過分領域強化學習形成的內部專業策略,並未將Claude或Fable列為該階段的教師。然而,技術報告並未完整披露預訓練語料、監督微調數據、獎勵模型數據與合成任務的來源,因此無法證明外部模型輸出從未進入K3的訓練流程。獨立評測顯示,K3在Frontend Code Arena等評測中處於領先位置,在部分智能體與程式設計基準上接近或超過Claude、GPT系列;但在DeepSWE、FrontierSWE以及部分綜合知識工作評測中,仍落後於Claude Fable 5或GPT-5.6 Sol。

圍繞K3的爭議始於今年2月,Anthropic指控月之暗面、DeepSeek與MiniMax透過大量虛假帳戶及代理渠道獲取Claude輸出,總計產生超過1600萬次交互,其中與月之暗面相關的活動超過340萬次,目標涵蓋智能體推理、工具調用、程式設計、數據分析、計算機操作與計算機視覺。美國白宮科技政策辦公室主任Michael Kratsios近日更表示,美方掌握的信息顯示月之暗面曾蒸餾Anthropic的Fable模型,用於K3開發。針對「工業級蒸餾」的調查、制裁與實體清單措施,已被美國官員放上討論桌面。

中國商務部則於7月27日作出直接回應,指出美方忽略了中美相關模型發布時間間隔很短、中國模型已具備領先能力等事實,並稱有關說法缺乏實際證據與法律依據。商務部同時表示,模型蒸餾是行業普遍使用的技術,美國企業也在研究與利用中國開放模型。業內人士分析,Fable 5公開可用與K3發布之間時間很短,要在這段時間內完成海量數據獲取、後訓練、評測與產品部署,並以此解釋K3的全部能力,並不符合超大模型通常的研發週期。開放權重本身無法直接回答數據來源問題。2.

8兆參數的Stable LatentMoE、KDA與Attention Residuals、九教師MOPD、百萬Token強化學習,以及MoonEP、FlashKDA與AgentEnv,共同構成了一條相對完整的能力增長路徑。月之暗面證明了一套足以生產前沿模型的架構、演算法與基礎設施,但尚未能自證蒸餾陷阱。這份技術報告是否足以平息外界質疑,仍有待時間與更多獨立驗證來解答。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

10 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

11 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

15 分鐘前