又一國產MoE旗艦模型登場!躋身全球開源第三,價格對標DeepSeek-V4-Pro
作者 | 程茜 編輯 | 李水青 9月20日報道,今日,階躍星辰發佈新一代MoE旗艦模型Step 5 Preview。該模型專為真實世界Agentic任務打造,總參數量600B、激活參數27B,支持100萬Token上下文窗口,原生支持文本與視覺輸入。在全球AI榜單Artificial Analysis Intelligence Index中,Step 5 Preview得分44分,位居開源模型第三,排在其前面的開源模型是Qwen3.8 Max(0902)、GLM-5.3(max)。
根據階躍公開的基準測試結果,Step 5 Preview在Agent長週期CLI任務測試、金融投資研究評測FrontierFinance,以及跨領域深度研究評測DRACO等測試中優於Kimi K3、GLM‑5.3,略遜色於GPT-6 Astra或Claude Opus 5。根據Artificial Analysis的榜單,該模型的輸出速度為100 token/秒,排名第6。在成本方面,據階躍官方數據,Step 5 Preview單任務成本為Claude Opus 5(max)的1/8。Artificial Analysis的數據顯示,前者單次總開銷0.71美元(約合人民幣4.
76元),後者為5.86美元(約合人民幣39.25元)。Step 5 Preview的價格為每百萬token輸入價格(緩存未命中)7元、輸入價格(緩存命中)0.35元、輸出價格20元。對比來看,該模型的價格可對標DeepSeek-V4-Pro-0813的高峰時段。體驗Step 5 Preview後發現,該模型擅長理解複雜任務、分步驟落地執行、文檔轉PPT、視覺網頁、3D交互、模擬推演等多種真實的工作場景,可處理圖片、文字、3D等混合的複雜需求,並獨立輸出可用結果。但在對視覺設計要求更復雜的場景,其產出形式缺少多元化視覺素材,需要用戶介入迭代指令,才能達到更為理想的設計效果。
Step 5 Preview目前已全量開放,將於10月15日開源。國內開放平臺 API 接入:https://platform.stepfun.com/ 國外開放平臺 API 接入:https://platform.stepfun.ai/ Studio平臺在線體驗地址:studio.stepfun.com 一、實測四大案例:博客一鍵變PPT,7輪模擬經營後直出可交互覆盤網頁 體驗了Step 5 Preview在執行多輪長任務、抽象提示詞理解、原生視覺等方面的能力,大部分任務一次輸出即可完成。我們將Step 5 Preview的博客鏈接上傳,讓其直接生成面向非技術人員的PPT。
可以看出,整個PPT內容重點明確、風格統一,在關鍵的數據上有突出顯示,並且在每頁PPT的下方還為演示者劃了重點。不過稍顯美中不足的是,PPT的表現形式都是在文字的樣式、大小上下功夫,沒有圖表、配圖等多元化的設計。第二個案例,上傳了一個抽象的提示詞“一曲流動的詩篇:駕馭風與線條,在由光影變幻、斑斕色塊、溫柔記憶與空靈旋律交織的夢幻圖景中緩緩穿行。”Step 5 Preview先自己拆解需求,將提示詞進行了擴寫然後生成對應的視覺網頁。不過網頁初版的背景較為單調,只有鼠標對應劃過位置會產生光暈。進一步要求它背景要更具設計感,結合文字內容的元素設計。
Step 5 Preview重新生成的頁面中,文字會隨鼠標滾動出現,且背景的色調、元素也會伴隨文字變化。第三個案例是讓Step 5 Preview使用Three.js開發卡帕多奇亞熱氣球交互場景的網頁應用,並要增加不同的交互按鈕、互動流暢。從該模型一次生成的效果來看,整個畫面都基本符合需求,在功能框中,用戶可以調整風向、日照時間、熱氣球數量,並實時查看效果。最後是一個複雜項目,讓Step 5 Preview幫模擬經營一家新式茶飲小店。Step 5 Preview扮演創業模擬Agent,進行分步規劃。
該模型經營過程劃分為7輪,分別為商業模式與選址策略、選址落地與證照辦理、產品體系與定價策略、供應鏈搭建與首批備貨、裝修動線與設備採購、開業引爆與人員就位、終局報告。在模擬過程中,Step 5 Preview在每一輪都會提出多個方案,並同步輸出每個方案對應的詳細內容與簡單直接的決策核心要素、給出建議,並在選擇方案後再進行推進。與此同時,當選定某一方案並給出如“運營經驗少,想尋求自主運營投入最少的方案”的理由時,Step 5 Preview會在接下來的多輪決策中基於此提出建議。最終根據模型估算,這家茶飲小店達成月淨利2.5萬元,賬戶留存現金18.6萬元,同時積攢了1450名排隊等候的學生客群。
最後,Step 5 Preview還能把前述的所有決策流程生成一個交互式的產品,將所有方案的側重點、可複用的結論都進行總結提煉。二、22小時優化GPU內核,峰值性能提升至508 TFLOPS 階躍官方也放出不少Step 5 Preview的案例。在真實軟件工程方面,Step 5 Preview可以進行Web開發與視覺設計。如下面的案例就是模型基於一張照片生成的可編輯3D環境,用戶可以在帶擺放反饋的情況下移動和旋轉傢俱或以第一人稱視角參觀房間。
第二個案例是基於歷史資料構建的交互式歷史圖冊,其以一本1922年的旅行指南為基礎,通過路線、車站、行程規劃與票價計算重建九廣鐵路,讓檔案資料的呈現形式更生動。在長程任務執行中,階躍選擇了優化GPU Kernel、訓練數據流程兩個場景。首先是優化GPU Kernel案例,Step 5 Preview在24小時內,在一張NVIDIA H100 GPU上從零開始優化一個MLA GPU內核。該模型自主修改、運行內核並測量吞吐量,經過約22小時將峰值性能提升至508 TFLOPS,超越Claude Opus 5的493 TFLOPS。
其次是優化後訓練數據流程,Step 5 Preview在24小時內,通過自動化後訓練提升了Qwen3-30B-A3B基礎模型在AIME24上的表現。經過後訓練,模型在AIME24官方測試集上的準確率由53.3%提升至60%,表現與Claude Opus 5持平,消耗的token更少。除了編程,在沒有做任何Pokémon專項優化的情況下,Step 5 Preview還在Pokémon Red遊戲中,持續完成超過3000 Turns,累計交互接近600萬Tokens。
這一遊戲的難點在於需要持續推進一個很遠的目標,模型需要記住之前獲得的信息、管理資源、完成相互依賴的任務,並在原有計劃行不通時重新調整。對於人類玩家來說,完成主線通常需要約26小時。此外,Step 5 Preview還可以實現大規模研究、結構化分析、交互式報告等。三、Agent長週期CLI、金融投資等任務,表現優於Kimi K3、GLM‑5.3 階躍公開的第三方以及其內部基準測試中,Step 5 Preview與GPT‑6 Astra、Claude Opus 5、Kimi K3、GLM‑5.3進行了對比。
在Agent長週期CLI任務測試、金融投資研究評測FrontierFinance,以及跨領域深度研究評測DRACO等多個測試中,Step 5 Preview的表現都優於Kimi K3、GLM‑5.3,僅次於GPT-6 Astra或Claude Opus 5。在真實任務場景,階躍內部構建了測試集StepCodeBench。該測試集覆蓋553個獨立代碼倉庫、9類任務、20個應用領域和33種編程語言。基於該評測,Step 5 Preview在整體任務成功率和跨場景穩定性等方面的綜合得分為49分,超過Kimi K3、GLM‑5.3。
根據博客信息,在獲得開發文檔和用戶授權後,Step 5 Preview可以直接調用相機、COM端口、截圖和模擬鼠標輸入,完成設備側的開發與調試。例如下面的案例就是Step 5 Preview連續工作超過3小時,根據設備反饋不斷編寫、運行並修改代碼。Step 5 Preview根據自然語言需求,自主閱讀ESP32設備及相關API開發文檔,將一塊ESP32-S3開發板改造成支持藍牙按鍵與語音輸入的Vibe Coding鍵盤。
在金融領域,階躍構建了FinStepBench-LiveSearch、FinStepBench-CorporateValuation、FinStepBench-DeepResearch三項內部測試,考察模型是否具備紮實的金融專業知識,是否能夠建立跨行業之間的因果聯繫,以及是否能在信息不完整、數據口徑不一致的情況下藉助工具完成嚴謹分析和建模。再加上,Step 5 Preview在金融領域的信息檢索、估值和完整金融研究流程上得分較高。在外部基準測試FrontierFinance中,該模型的得分僅次於Claude Opus 5。
結語:大模型競賽從算力軍備賽轉向算力轉化率之爭 階躍的博客中提到,過去,大模型Scaling的核心邏輯是用更多計算換取更強智能,但隨著模型規模和任務複雜度持續增長,計算成本也被同步放大,Scaling的核心關注變成如何更高效地把計算轉化成模型能力。這也是其從Step 3.5 Flash、Step 3.7 Flash到Step 5 Preview持續探索的問題。他們認為,下一階段的Scaling,不只是更多計算,也包括更高效率的計算。可以看出,未來大模型競賽的核心不僅是原始算力的軍備競賽,還包括算力轉化率競賽。
誰能用更少的激活計算,輸出更強真實世界任務能力,就能更適配Agent時代的產業落地趨勢,效率已成為大模型的核心命題。
Related
相關文章

斷網仍可作戰:AI 模型加持的無人機可實現戰場自主識別、打擊目標
作者:遠洋 責編:遠洋 評論: 9 月 20 日消息,據 Arstechnica 報道,隨著歐洲各國軍隊開始適應現代戰爭當中人工智能與無人機的應用,一家獲得北約支持的初創企業正在協助部署由 AI 驅動的目標探測與篩選系統。這套系統可以直接在小型無人機上運行,用於偵察以及打擊任務。

Opus 5.2 與 Gemini 4 Pro 未經官宣已上線,前沿模型的發佈流程正在被壓縮
AGI-Signal2026.09.20 18:25 · 來自海外全文2787字00:00 / 07:27沒人開發佈會。可硅谷這一週,比任何發佈會都熱鬧。過去兩週,Anthropic 將兩個尚未命名的模型接入生產接口,谷歌為下一代旗艦沿用舊版本號、投放到第三方盲測平臺,OpenAI 在 Astra 之後未再公開發聲。

東風人形機器人"小東"下月進廠:汽車大模型給具身智能當"師傅",年底要和真人掰手腕
T1 人形機器人9月20日,上緯新材旗下品牌上緯啟元發佈啟元Q1、T1兩款消費級人形機器人。董事長彭志輝介紹,啟元Q1主打自定義特性,支持自定義互動動作與3D打印改造外觀,用戶可自由調整外觀造型、性格特質、動作姿態和語音音色;T1細節暫未披露。

一顆 260 克的"雞蛋關節":稚暉君發佈啟元 Q1、T1 人形機器人
T1 人形機器人發佈於AI新聞資訊發佈時間 :2026年9月20號 17:09閱讀 :1分鐘9月20日,在2026啟元機器人全球產品發佈會上,上緯新材旗下消費級人形機器人品牌上緯啟元正式發佈啟元 Q1、啟元 T1兩款人形機器人。上緯新材料科技股份有限公司董事長、智元機器人聯合創始人兼首席技術官彭志輝(稚暉君)介紹,啟元 Q1主打自定義特性,支持自定義設計互動動作與3D 打印改造外觀,用戶可自由調整機器人的外觀造型、性格特質、動作姿態與語音音色。

微信 AI 團隊開源 WeKnora:知識庫不再只“動嘴”,還能在沙箱裡“動手”
它的定位可以概括為一句話:讓知識庫不只是“能查到答案”,而是“能動手去執行”。WeKnora 想解決的是大模型落地時最現實的問題——知識躺在文檔裡,模型說得頭頭是道,但要把它們變成可驗證的結果,中間缺一雙手腳。anydoc 解析 + GraphRAG,把雜亂文檔變成知識圖譜第一個亮點是 anydoc 解析:PDF、Word、Markdown、網頁等多種格式可直接導入,無需預先轉換;配合 Wiki 模式,能把雜亂的文檔自動整理成結構化的知識體系。

APUS 開源國內首批Jev跨平臺復現:國產模型實現秒級決策
9月19日,中國人工智能企業APUS旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果 9月19日,中國人工智能企業APUS(麒麟合盛網絡技術股份有限公司)旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果,幷包裝成了開箱即用的Agent Skill fast-browser-use,支持純本地模型離線執行。