匿名模型Kivine外網刷屏,開發者們都在猜:這是Kimi-K3?

重點摘要
大模型競技場 Arena 上近日出現了一個名為 Kivine 的匿名模型,迅速在海外開發者社群中引發熱議。從生成的網頁遊戲到互動模擬器,各種展示片段不斷在外網刷屏。許多開發者比對後發現,這個神秘模型的編碼能力甚至超越了 Opus 4.8,加上其匿名代號與過去 Kimi 系列模型的命名邏輯高度相似,越來越多聲音指向一個結論:Kivine 很可能就是月之暗面即將推出的 Kimi-K3。 這波猜測並非空穴來風。
大模型競技場 Arena 上近日出現了一個名為 Kivine 的匿名模型,迅速在海外開發者社群中引發熱議。從生成的網頁遊戲到互動模擬器,各種展示片段不斷在外網刷屏。許多開發者比對後發現,這個神秘模型的編碼能力甚至超越了 Opus 4.8,加上其匿名代號與過去 Kimi 系列模型的命名邏輯高度相似,越來越多聲音指向一個結論:Kivine 很可能就是月之暗面即將推出的 Kimi-K3。這波猜測並非空穴來風。
7 月 14 日,Kimi API 開放平台短暫上線了一個名為「Kimi K3 launch limited-time recharge campaign」的推廣頁面,標註 7 月 15 日 00:00 啟動充值優惠活動,提供 10% 至 30% 的額度回饋。該頁面上線僅數小時後便被撤下,但截圖早已在各大技術社群流傳。緊接著,7 月 16 日凌晨,月之暗面官方在 X 平台發布了一則 36 秒的預熱短片,眼尖的網友在畫面中捕捉到一閃而過的「3」字彩蛋,進一步暗示 K3 即將正式亮相。三項線索疊加,讓開發者們幾乎篤定 Kivine 就是 K3 的測試版本。
網友們對 Kivine 的實際表現給予高度評價。開源生態基金會 SuperGemma 創始人 Jun Song 指出,從生成結果來看,Kimi 明顯比 Opus 強,甚至認為 K3 已達到 Opus 5 的水平。另有網友形容 K3 的發布是另一個「DeepSeek R1 時刻」。科技記者 Chris 在對比 K3 與 GPT-5.6 Sol 後則認為,雖然 GPT-5.6 在光照與特效上更勝一籌,但 K3 的畫面流暢度明顯更好。實際測試案例充分展現了 Kivine 的強大能力。有網友僅用一句提示詞,便生成了一個類似《我的世界》的像素風網頁遊戲。
遊戲不僅還原了方塊世界的視覺風格與空間結構,角色移動、視角控制等基本操作邏輯也完整復現,具備基本可玩性。這類遊戲生成任務同時考驗模型的前端渲染、邏輯推理、長上下文一致性與跨函數聯動,Kivine 的完成度令開發者驚豔。另一個案例是一款名為「Qasr d-Rimal」(沙丘城堡)的沙漠集市商隊模擬遊戲。從公開影片可見,畫面視角可自由旋轉,所有按鈕都能點擊並觸發對應回饋,資源計數、時間切換、風系統等模組彼此聯動,相當於一次性生成了內建完整 3D 引擎、UI 交互邏輯與狀態管理系統的單檔 HTML 應用。更具代表性的是一個名為「達文西工坊」的模擬器,主題圍繞達文西設計的撲翼機。
該界面融合文藝復興工坊的藝術風格與歷史元素,模型不僅生成視覺畫面,還準確理解木材、亞麻布、黃銅等材質組合,以及對鳥翼空氣動力學的模仿。這顯示 Kivine 具備跨領域知識調用與整合能力,而非僅停留在表面風格模仿。也有網友同時用 Kivine 與 Fable 5 執行同一組提示詞,生成宇宙模擬系統。對比之下,Fable 5 完成速度更快,操作手感更乾淨穩健;而 K3 的結果則顯得更狂野、更複雜,視覺野心更大,甚至包含第一人稱高速行星自轉效果。這顯示兩者在設計取向上有所差異。關於 K3 的技術規格,外媒與社群爆料顯示,其總參數量約為 2 到 3T,超越 DeepSeek V4 Pro 的 1.
6 萬億參數,成為目前參數規模最大的國產大模型。上下文視窗長度可達 100 萬,而前代 K2.6 僅有 256K,世代差距顯著。在基準測試方面,K3 的程式設計能力已超越 Opus 4.8 與 GPT-5.5。架構方面,開發者透露 K3 不再沿用 K2.6 的 MoE 架構,而是採用全新的 Kimi Delta Attention(KDA)設計,專為長程 Agent 任務優化。這套實驗性混合注意力機制能在維持性能的同時大幅降低計算開銷,在受限硬體條件下跑出更佳結果。
另有消息指出,K3 可能採用 MLA(多頭潛在注意力)與 KDA 的混合架構,以延續 Kimi 長文本優勢,優化百萬級 token 的處理效率。此外,K3 還將具備 Agent Swarm(集群智能體)能力,可將複雜任務拆解給多個子 Agent 並行處理。K2.5 已支援最多 100 個子 Agent 並行,K2.6 能執行 12 至 13 小時的自主編碼任務,調用數千次工具;K3 預期將在此基礎上進一步擴展。理性來看,Kimi-K3 不太可能直接超越 Anthropic 的 Fable 5。Fable 5 與 GPT-5.
6 Sol 分別是 OpenAI 與 Anthropic 的旗艦產品,參數規模與訓練成本皆居行業頂端,國產模型在算力受限下短期內難以企及。然而,若 K3 真能達到 Opus 4.8 的水平,便已是重大突破。目前揭露的跑分顯示,K3 在程式設計能力上優於 Opus 4.8 與 GPT-5.5,這在國產模型中已相當能打。目前網友測試多集中於前端程式碼生成,隨著預熱影片發布,Kimi-K3 正式登場可能已箭在弦上,屆時模型的全貌與實際表現,將有待進一步驗證。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。