什麼國產模型,都能跟Fable 5掰手腕了?全方位實測Kimi K3

2026年7月17日 20:02
什麼國產模型,都能跟Fable 5掰手腕了?全方位實測Kimi K3

重點摘要

Kimi 昨晚發表了旗下迄今為止能力最強的模型 Kimi K3,並宣布將於 7 月 27 日全面開源,同時釋出技術報告。消息一出,立刻在 AI 圈引起轟動,社群平台充斥著對其性能的驚嘆與討論。Kimi 官方在發佈公告時,還特意以文言文「犯其至難而圖其至遠者,發之以勇,守之以專,達之以強」開場,這種充滿文化底蘊的開場白,也讓不少網友聯想到其他大模型公司近期類似的手法,引發熱議。 更令人關注的是,根據 Arena.

站內 AI 整理稿

Kimi 昨晚發表了旗下迄今為止能力最強的模型 Kimi K3,並宣布將於 7 月 27 日全面開源,同時釋出技術報告。消息一出,立刻在 AI 圈引起轟動,社群平台充斥著對其性能的驚嘆與討論。Kimi 官方在發佈公告時,還特意以文言文「犯其至難而圖其至遠者,發之以勇,守之以專,達之以強」開場,這種充滿文化底蘊的開場白,也讓不少網友聯想到其他大模型公司近期類似的手法,引發熱議。更令人關注的是,根據 Arena.ai 上的前端能力排行榜,Kimi K3 已經躍居第一,超越了先前全球最強的模型 Fable 5 以及 GPT 5.6 Sol。

不過,Kimi 官方也坦承,K3 的整體表現仍落後於最強的閉源模型 Claude Fable 5 和 GPT-5.6 Sol,但強調 K3 已穩定超越除了上述兩者之外的所有模型。這番自信的宣告,讓外界對其開源後的影響力充滿期待,甚至有人形容此舉將使全球大模型水準在一夜之間,提升到僅次於 Fable 5 的層級。Kimi 這次的定價與發佈時間點,也展現出十足的自信。每百萬 token 輸入定價 20 元,輸出則高達 100 元,已與 GPT 5.6 terra 的收費水準相當。

而選擇在世界人工智能大會(WAIC)前夕發佈,更是背水一戰的姿態,若表現不如預期,昂貴的定價與高調的時機恐將成為外界批評的焦點。但若能頂住壓力,也將證明國產模型確實具備與國際頂尖模型一較高下的實力。為了驗證 Kimi K3 的真實實力,有測試者立即下單高級訂閱,進行了一系列實際測試。首先在圖像生成與遊戲開發能力上,測試者隨手畫了一張手繪草圖,描繪了類似經典遊戲《雷霆戰機》的畫面,並將圖片直接傳給 Kimi K3,簡單附上提示詞。結果 Kimi K3 不僅準確理解測試者的意圖,辨識出飛機、敵人與道具標記,還直接生成了一款完整的手繪風格小遊戲。

雖然第一版遊戲直接還原了草圖上所有抽象標記,但經過一輪修改後,第二版成品已相當成熟,美術風格自然、遊戲難度適中,甚至還內建了墜機動畫。相比之下,對照組的 Claude Opus 4.8 則完全無法理解相同草圖的邏輯,直接失敗。除了簡單的 2D 遊戲,Kimi K3 的多模態能力也延伸至更複雜的場景。測試者要求它製作一款 3D 的點球大戰遊戲,Kimi K3 不僅按照要求完成,還會在過程中自行測試遊戲邏輯,發現 bug 會主動修復,甚至考量到遊戲難度平衡,在跑完完整比賽後,發現進球率過低而主動調整。最終完成的遊戲不僅可以選擇射手與門將,還配有音效,遊玩體驗相當完整。

此外,Kimi K3 的 Vibe Motion 影片動效能力也令人驚豔,測試者要求製作一段展示 AI 模型參數量增長的 15 秒一鏡到底短片,雖然畫面中仍存在一些細微瑕疵,但作為一次直出的成果,其效率遠超傳統製圖軟體。在工程調試方面,Kimi K3 結合官方 App 中的 Kimi Work 功能,展現出強大的電腦操控能力。測試者將一個包含小遊戲與番茄鐘功能的桌面寵物專案資料夾交給 Kimi K3,要求找出三個 bug。結果 Kimi K3 經過自行設計的測試後,確實找到並修復了三個錯誤,其中包括測試者早已實際遭遇、番茄鐘結束後寵物便定格不動的問題,證明了其處理複雜程式碼與除錯的能力。

總體而言,Kimi K3 的表現確實追上了海外頂級閉源模型的腳步,在多模態理解、程式碼生成與工程應用上展現出強大的實力。雖然價格偏高,但考量到其龐大的參數量與算力限制,其表現已屬頂尖。不過,正如官方所承認,在前端領域取得第一,並不代表它已是全科狀元,在處理更複雜的任務時,與 Fable 5、GPT-5.6 Sol 等模型仍有差距。然而,Kimi K3 的出現,無疑驗證了國產模型與國際頂尖水準之間的差距正在急遽縮小。先前智譜 CEO 曾表示國產模型落後國外約半年到一年,如今看來,這個差距已從「望塵莫及」變成了「望其項背」。

隨著 K3 即將開源,外界也高度期待,這股開源力量將如何進一步推動整個產業發展,讓人人都能用上接近 Fable 等級模型的願景,早日成真。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

10 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

11 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

15 分鐘前