智東西生成式AI

匿名模型Kivine外網刷屏,開發者們都在猜:這是Kimi-K3?

2026年7月16日 19:56
匿名模型Kivine外網刷屏,開發者們都在猜:這是Kimi-K3?

重點摘要

匿名模型Kivine在外網刷屏,開發者猜測其為Kimi-K3測試版,因測試表現驚人且官方出現預熱線索。網友實測顯示Kivine能一句話生成遊戲與模擬器,在3D引擎、UI交互及跨領域知識整合上表現出色。外洩資訊指出K3參數量達2到3T,採用新架構並強化長文本處理與集群智能體能力,但正式發布前仍需理性看待對比頂尖模型。

站內 AI 整理稿

這兩天,AI圈最熱的話題莫過於大模型競技場Arena上突然冒出的一個匿名模型「Kivine」。這個模型沒有公開背景,卻憑藉驚人的前端生成與3D渲染能力瞬間刷屏。開發者們經過一番測試比對,再結合過往Kimi系列模型匿名代號的命名規律——Kimi-K2.5叫「Kiwido」、K2.6叫「Kiwire」——越來越多人推測,這個Kivine很可能就是月之暗面即將推出的新一代模型Kimi-K3。線索不只來自代號。

7月14日,Kimi API開放平台上短暫出現了一個推廣頁面,標題寫著「Kimi K3 launch limited-time recharge campaign」,活動從7月15日零時啟動,充值可獲10%至30%額度。這個頁面上線僅數小時便被撤下,但截圖早已在各大技術社群瘋傳。緊接著,7月16日凌晨,月之暗面官方在X平台發布了一段36秒的預熱短片,眼尖的網友立刻捕捉到畫面中一閃而過的「3」字彩蛋。種種跡象指向同一個結論:Kivine就是Kimi-K3的測試版本。網友們對Kivine的表現給予極高評價。

開源生態基金會SuperGemma創始人Jun Song直言,從生成結果來看,「Kimi明顯比Opus強」,並認為Kivine已達到Opus 5的水準。有人稱Kimi-K3是一個新的里程碑,尤其在3D與前端任務上的表現「不可思議」,甚至將它的發布比作另一個「DeepSeek R1時刻」。科技記者Chris在對比K3與GPT-5.6 Sol(extra high)後認為,GPT-5.6在光照與特效方面更勝一籌,但K3的畫面流暢度遠高於對手。網友們也紛紛曬出實測結果,展現Kivine的驚人能力。有人只用一句話就生成了一個類似網頁版《我的世界》的像素風遊戲。

遊戲生成測試向來是檢驗大模型綜合能力的經典場景,涉及前端渲染、邏輯推理、長上下文一致性和跨函數聯動等多個技術維度。從輸出結果來看,Kivine在視覺風格還原、空間結構建模及基礎操作邏輯上均達到極高完成度,遊戲畫面透視關係穩定,角色動作流暢,整體具備基本可玩性。另一名網友則用Kivine生成了名為「Qasr d-Rimal」(沙丘城堡)的遊戲,畫面呈現沙漠集市商隊模擬的視覺風格。影片顯示,遊戲視角可自由旋轉,所有按鈕均可點擊並觸發對應反饋,資源計數、時間切換、風系統等模塊聯動響應,等於模型一次性生成了包含完整3D引擎、UI交互邏輯與狀態管理系統的單檔案HTML應用。

還有網友製作了「達芬奇工坊」(Officina di Leonardo)模擬器,主題是達芬奇設計的撲翼機(Ornithopter)。這個案例不僅展現了3D引擎與UI交互能力,更凸顯Kivine的跨領域知識調用能力。模擬器融合文藝復興工坊的美術風格與歷史元素,模型準確理解達芬奇撲翼機的歷史背景與技術細節,包括木材、亞麻布、黃銅的材質組合,以及對鳥翼空氣動力學的模仿。這說明Kivine具備跨領域知識的整合能力,遠不止於表面風格模仿。另有網友讓Kivine與Fable 5使用同一組提示詞生成宇宙模擬系統。

對比之下,Fable 5完成速度較快,操作手感更乾淨穩定;而K3的結果則更狂野、更複雜,視覺野心更大,甚至包含第一人稱高速行星自轉效果。與此同時,外網也流出K3的部分技術規格。資料顯示,K3總參數量達到2至3T(約2.5T),規模超過1.6萬億參數的DeepSeek V4 Pro,是目前參數量最高的國產大模型。上下文窗口長度可達100萬token,而前代K2.6參數量僅1萬億、上下文僅256K,兩代性能差距極為顯著。根據社區流出的基準測試數據,K3在編程能力上已超越Opus 4.8與GPT-5.5。在技術架構方面,開發者透露K3不再沿用K2.6與K2.

7 Code的MoE架構,而是採用全新的「Kimi Delta Attention(KDA)」架構,專為長程Agent任務優化。KDA屬於實驗性混合注意力設計,能在保持性能的同時大幅降低計算開銷,在受限硬體條件下跑出更好結果。另有消息指出,K3可能採用MLA(多頭潛在注意力)與KDA混合架構,讓MLA層延續Kimi長文本優勢,進一步優化百萬級token的處理效率。此外,K3也將擁有Agent Swarm(集群智能體)能力,能將複雜任務拆解給多個子Agent並行處理。前代K2.5已支援最多100個子Agent並行,K2.

6則可跑12到13小時的自主編碼任務、調用數千次工具,K3預計在此基礎上進一步擴展。理性來看,Kimi-K3不太可能直接超越Anthropic的Fable 5或GPT-5.6 Sol。Fable 5與GPT-5.6 Sol分別是OpenAI與Anthropic的旗艦產品,參數規模與訓練成本皆處於行業頂端,國產模型在算力受限的情況下短期難以比肩。然而,若K3真能達到Opus 4.8的水準,對國產模型而言已是不小的突破。從目前流出的跑分來看,K3的編程能力優於Opus 4.8與GPT-5.5,這個成績已經相當能打。

隨著月之暗面官方預熱影片的發布,Kimi-K3的正式登場可能已箭在弦上,屆時模型究竟能展現出何種完整實力,各界正拭目以待。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

44 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前