全球開源前二,階躍終於回來了

2026年9月30日 07:55
站內 AI 整理稿

Step 5 Preview 回到全球第一梯隊 作者丨吳海明 編輯丨李娜 岑峰 兩年前,階躍星辰第一次在基模圈公開亮相時,憑藉 Step 1 炸了場,同年接連發布 Step 1V 和萬億參數基座模型 Step 2,彼時行業仍相信,模型越大、能力越強。誰推進 Scaling Law,誰就更接近牌桌中心。但過去一年,它的曝光似乎更多集中在另一端:多模態模型、手機、汽車、端側模型和 Agent。相比之下,那個需要和 Qwen、Kimi、GLM 正面比較的旗艦基模,似乎並不是討論中心。Step 5 Preview 改變了這個局面。

在 Artificial Analysis Intelligence Index 上,它拿到 44 分,位列全球開源前二,進入頂尖旗艦模型比較的區間。這個成績也證明了一個問題:階躍在押注終端和 Agent 的同時,前沿基座模型的能力上限並沒有掉隊。但對 Agent 來說,進入榜單隻拿到了入場券。真正困難的是,模型離開 Benchmark 以後,能不能在幾十甚至上百步操作裡,把一件事情從頭做到尾。為此,我們上手進行了實測。01實測:從製作 3D 遊戲看 Step 5 Preview 的能力《超級馬里奧》讓一代人第一次相信:一套簡單規則,也能組成一個完整世界。

小時候按下跳躍鍵時,總會想到同一個問題:如果有一天,我也能做一款屬於自己的遊戲呢?那時候,這個念頭通常止步於門檻,因為遊戲不是一張圖、幾段劇情或一段代碼,而是角色、場景、碰撞、交互、資源導出和工程構建共同成立的結果。往往需要一個龐大的團隊或者多個跨國公司共同協作才能把一個類似想法推進成可運行的系統。今天,我們在這次測試裡,選擇把任務放進專業軟件鏈路裡:Claude Code CLI 作為 Agent 工作臺,Blender 負責 3D 資產和關卡,Three.js/Vite 負責網頁遊戲呈現。

測試題是讓 Step 5 Preview 製作一個可運行的 3D 迷你遊戲《星躍島:能量快遞》,具體題目如下:代碼塊請使用 Claude Code CLI 調用本機 Blender,完成一個可運行的 3D 迷你網頁遊戲。- 遊戲名稱為《星躍島:能量快遞》,主角是原創蘑菇頭角色“菇嚕”,不得使用馬里奧、奇諾比奧、任天堂 Logo、貼圖或音效。- 請在 Blender 中創建角色、6 個浮空平臺、5 個能量球和 1 個終點信標,導出 .blend 與 GLB 文件;- 隨後使用 Three.

js / Vite 創建網頁遊戲,加載 GLB 資產,實現 WASD/方向鍵移動、空格跳躍、墜落重生、收集計數、計時、重開按鈕和通關提示。- 請同時生成測試腳本並運行 npm test、npm run build,將源碼、構建產物、日誌和驗收報告保存到指定工作目錄。這裡考的是模型能不能把一個創意變成可檢查、可構建、可繼續迭代的工程資產。我們沒有替模型寫代碼或操作 Blender,而是把原本的大任務拆成四個階段:先完成主角“菇嚕”,再搭建浮空島關卡,隨後導出 GLB 資產,最後進入網頁遊戲工程。每個階段內部的代碼編寫、Blender 操作、文件生成和調試仍由 Step 5 Preview 完成。

遊戲角色“菇嚕”站在遊戲起始浮空平臺遊戲的終點浮空平臺,有一個能量球和一個終點信標完整遊戲設計圖:6 個浮空平臺、遊戲角色“菇嚕”和終點信標拆分之後,任務開始穩定向前推進。Step 5 Preview 先完成角色與關卡資產,再把 Blender 生成的模型接入 Three.js/Vite 項目,繼續處理移動、碰撞、能量球收集和終點判定。中間仍有修改和調試,但最終沒有重新推倒工程,而是在已有結果上繼續執行,直到項目可以運行。最終,《星躍島:能量快遞》能夠正常運行:玩家可以控制“菇嚕”在 6 個浮空平臺之間移動,收集 5 個能量球並抵達終點信標。

角色、場景、碰撞、基礎交互和網頁工程都已經接通,雖然部分視覺和操作細節仍然粗糙,但它已經不是一組靜態資產,而是一個可以實際遊玩的完整 Demo。一起來遊戲中體驗一下這款名為《星躍島:能量快遞》的 3D 網頁遊戲:執行結果說明:Step 5 Preview 能理解複雜目標,並通過調用 Blender 這類工程化工具把任務推進到最終構建。因此,這輪測試真正考驗的不僅僅只是代碼生成,而是在跨越 Blender、文件系統和網頁工程的長任務裡,模型能否保持目標、使用工具、根據中間結果繼續執行,並最終完成交付。

如果用一句話總結測試結果,那就是:Step 5 Preview 已經具備從自然語言需求到遊戲工程構建的完整執行能力,而且面對複雜項目可以以更清晰的階段拆分來完成任務。根據階躍官方披露的消息,Step 5 Preview 的 Coding 能力並不侷限於傳統代碼任務。它可以做複雜軟件工程(包括長程規劃任務)、前端和視覺開發,也能進入可編程硬件場景;當任務持續數小時、需要不斷根據結果調整時,模型也能繼續推進。在內部和外部專家參與的評測中,約 70% 的評測者認為 Step 5 Preview 可以自主完成中高複雜度的 Coding 任務。

()同時,Step 5 Preview 還在專業知識工作、金融分析等任務場景中展現出優越表現:在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投資研究評測 FrontierFinance,以及跨領域深度研究評測 DRACO 上僅次於 GPT-6 Astra 或 Claude Opus 5,領先其他參評開源模型。

Step 5 Preview 在 4 項金融評測的信息檢索、估值和完整金融研究流程上都取得了優秀的結果真正進入生產級 Agent 階段以後,競爭已經不只是模型能不能完成某一步,而是它能不能跨文檔、跨工具、跨輪次持續執行,同時把錯誤率、時間和成本控制在可接受的範圍裡。Step 5 Preview 的 1M 上下文和麵向長程任務的設計,為這類工作提供了基礎條件;同時它還能在多種真實業務場景中給出穩定的生產能力。02為什麼 Step 5 Preview 值得被討論?

根據 Artificial Analysis (AA 榜單)模型頁截圖,Step 5 Preview 的 Artificial Analysis Intelligence Index 為 44,輸出速度為 99.8 tokens/s,單個 Intelligence Index task 成本為 0.71 美元;輸入價格為 1.00 美元/百萬 token,輸出價格為 2.70 美元/百萬 token,緩存摺扣為 95%。頁面還顯示,Step 5 Preview 支持文本和圖像輸入、文本輸出,上下文窗口為 1M token,參數規模為 600B。

這說明階躍此次帶來的 Step 5 Preview 是一套“智能、速度、成本、上下文窗口”的組合。Step 5 Preview 在 AA 榜單上模型頁截圖從 AA 的 Intelligence Index 看,Step 5 Preview 已經進入前沿模型隊列。該指數覆蓋知識工作、Agent 工作流、終端使用、編程、長上下文、文檔推理等多類任務,對一個面向 Agentic 任務的模型來說,這比單看某個問答榜單更接近真實使用場景。更關鍵的是任務成本,Agent 不是一次性回答問題,而是反覆讀上下文、調用工具、生成代碼、運行測試、根據報錯繼續修改。

只要任務變長,token 單價和緩存策略就會直接影響用戶是否願意讓模型多試幾輪。而這也是決定模型能否被開發者和企業用戶選擇,真正實現規模化商用的關鍵。從如下截圖來看,Step 5 Preview 憑藉 0.71 美元的單任務成本在 654 個模型中位於第 4 位(低成本前列),相當於Kimi K3 的35%。同時,這款模型也將模型能力、效率與成本最優平衡的帕累託前沿向外推進。對於長程 Agent 來說,這個位置意味著它不只是在“能力榜”上有競爭力,也在“多輪嘗試是否划算”這個問題上給出了更有吸引力的答案。

03手握三張牌,讓階躍進入國模牌桌中心Step 5 Preview 進入 AA 榜單全球前沿梯隊是重新衡量階躍的標誌性節點。階躍正在把前沿基座模型、全模態模型矩陣和終端量產能力擰成一股繩,塑造自己的競爭壁壘。1.Step 5 Preview 讓階躍進入全球前沿模型競爭區間。尤其對 Agent 任務而言,長上下文和較低調用成本意味著模型可以處理更長鏈路、更大工程和更多文件,不必把複雜任務拆成太多碎片。2.

過去一個季度,階躍先後發佈 Step Edge、StepAudio 3 系列,再到 Step 5 Preview,模型矩陣已經覆蓋了從雲端旗艦、Flash 高效模型、端側模型,到語音、視覺、生成、GUI 等專項能力的完整全模態矩陣。根據官方信息,StepAudio 3 Realtime 在 Artificial Analysis Conversational Dynamics 榜單中以 98.9% 位列第一,Speech Reasoning 準確率為 99.7%;StepAudio 3 ASR 在非流式語音識別準確性榜單中詞錯誤率為 1.7%,並列第一。

聽、說、看、生成和操作,不是分散能力,而是在被組織成一套完整模型體系。3.據官方公開數據,階躍模型已進入手機、汽車等真實設備場景量產落地;截至 2025 年底,其手機側模型裝機量超過 4200 萬臺,日均服務近 2000 萬人次,並覆蓋國內超50% 頭部手機品牌。和純 API 模型公司相比,終端入口的價值在於高頻、真實、複雜:低延遲、低算力、噪聲環境、隱私約束和用戶習慣,都會持續反向檢驗模型。從行業發展來看,基模公司的競爭,已經不再只是單一模型能力比拼,而是全棧技術能力與商業化落地的系統較量。

DeepSeek 的優勢在全球開發者影響力,阿里千問背靠雲和生態,智譜深耕企業交付,Kimi 更有 C 端產品心智。而階躍的獨特位置則是“AI+終端”:前沿模型負責複雜推理,全模態模型負責感知和表達,端側模型負責低延遲和高頻入口。同時,階躍選的這條路線也並不輕鬆。終端生態裡有手機廠商、車企、操作系統和應用權限;Agent 真正落地,還要解決安全、隱私、跨應用執行和用戶信任。通過 Step 5 Preview,說明階躍已經重新進入第一梯隊前沿模型的競技場,結合已有的全模態模型矩陣和終端量產能力,直接將階躍送上國產 AI 牌桌的中心。

大模型市場的終局仍未確定,頭部廠商之間的領先優勢不會一成不變,模型能力、成本結構、終端入口和工作臺體驗都可能重新洗牌。Step 5 Preview 的意義在於讓階躍重新進入這場牌局;接下來真正要看的,是模型能不能在更多真實工作流裡,把任務一次次交到終點。附在線體驗鏈接:https://studio.stepfun.com/

Related

相關文章

量子位生成式AI

Anthropic,你是來給智譜打廣告的吧!

。 事情的起因,是Anthropic一紙檄文狀告了智譜的GLM-5.3,大致意思是說: GLM-5.3這個模型啊,它已經很會找軟件漏洞、編寫攻擊程序,而且防濫用限制容易被繞過。大家得小心嘍~ 但如果你把這篇文章讀完吧,就會越發覺得不對勁兒。 因為Anthropic為了證明自己說的是有道理的,所以特意拿出了實測成績。

剛剛

微軟聯手哈佛MIT端出生物學世界模型Project Quine,一個週末篩出抗癌候選物

它與哈佛大學、麻省理工學院博德研究所聯手推出了一套實驗性多模態 AI 研究系統 Project Quine,定位很清晰:一套用於生物學研究的世界模型,要把計算生物學的建模和實驗室裡實打實的溼實驗接成一條線。Quine 的內核是一張覆蓋了基因組學、蛋白質、化學、細胞狀態和生物成像的聯合表徵世界模型,再配上交互式推理框架。

剛剛

蘇姿豐下月訪韓劍指HBM4,三星有望躋身AMD AI加速器內存供應鏈

據外媒9月30日報道,她預計下個月親赴韓國,與三星電子高層面對面會談,議題直指 AI 芯片與技術合作,而最受關注的一筆,是三星有望成為 AMD HBM4的供應商。這樁合作並非臨時起意。AMD 與三星接觸已有一段時間,今年3月雙方就簽署了圍繞 AI 存儲芯片與計算技術合作的諒解備忘錄,當時便有傳聞稱,三星已被 AMD 選為其 AI 加速器 HBM4芯片的優先供應商。

剛剛
鈦媒體生成式AI

獨家|元寶將殺入個人智能體大戰

字母榜2026.09.30 17:52 · 來自北京全文5253字00:00 / 15:20微信小微,繼續按兵不動文 | 字母AI騰訊正在加大對個人智能體(personal agent)的下注,這一次衝在前面的是元寶。字母榜(ID: wujicaijing)從知情人士處獨家瞭解到,元寶將推出個人智能體,產品形態和推出時間等尚未最終確定。

剛剛