階躍甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把開源旗艦的"性價比邊界"往外推了一格

AI資訊AI新聞資訊正文階躍甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把開源旗艦的"性價比邊界"往外推了一格發佈於AI新聞資訊發佈時間 :2026年9月20號 15:25閱讀 :1分鐘階躍今天全量開放新一代旗艦基座 Step5Preview,定位很明確——一款為真實世界裡 Agentic 任務而生的主力模型。它想解決的是 AI 模型裡那道經典的"帕累託題":能力、效率、成本三個目標互相拉扯,歷史上想在一個維度上往前走,往往得拿另一個維度去換;而推進帕累託前沿,不是讓取捨消失,而是用新設計把整條邊界往外推。這次的推法是稀疏 MoE 架構。
Step5Preview 總參數600B,但每次只激活27B,原生支持100萬 Token 上下文窗口,並且能直接吃文本和視覺兩種輸入。在 Artificial Analysis 的 Intelligence Index 裡,它拿到44分,擠進全球開源模型前三;更狠的是單任務成本只有 Claude Opus5的八分之一——同一筆預算換更強智能,或者同等能力以更低價格落地,兩條路它都給鋪了。硬實力在幾個高難度基準上露了臉。
在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投資研究評測 FrontierFinance,以及跨領域深度研究評測 DRACO 上,Step5Preview 僅次於 GPT-6Astra 或 Claude Opus5,把其他參評的開源模型甩在身後;GDPval-AA v2也採用了截至9月19日的最新結果,DeepSWE v1.1在 SWE-agent harness 下以 temperature=1.0、top_p=0.95評測。編程這塊,階躍自建了 StepCodeBench,覆蓋553個獨立代碼倉庫、9類任務、20個應用領域和33種編程語言。
Step5Preview 在整體成功率和跨場景穩定性上都站得住,Bug 修復、功能開發、重構、環境配置這類真實活兒都能接。一個演示裡,它讀著 ESP32設備的大量開發文檔,把一塊 ESP32-S3開發板改造成支持藍牙按鍵和語音輸入的 Vibe Coding 鍵盤,過程中自己開 COM 串口、調攝像頭、截設備圖、模擬鼠標,再根據真實報錯連續改代碼跑調試,一口氣幹了三個多小時。長週期任務更見真章。第一項實驗給24小時、一張 H100,讓它從零優化一個 MLA GPU 內核(頭維度512、batch1、64個注意力頭、8192token)。
Step5Preview 自主改代碼、跑內核、測吞吐,遇到跑得通卻降速的方案就放棄、從最佳版本接著爬,約22小時後把峰值性能頂到508TFLOPS,壓過了 Claude Opus5的493TFLOPS。第二項實驗同樣24小時,讓它通過自動化後訓練提升一個 Qwen3-30B-A3B 基礎模型在 AIME24上的表現,模型自己決定怎麼用標註 API、怎麼調數據,最終把準確率從53.3% 拉到60%,和 Opus5持平卻更省標註 token。前端與視覺上,它不只會寫網頁,還能調用 Blender 建並反覆改3D 資產,再接進 Three.
js 做交互應用和遊戲;甚至從一本1922年的《廣九鐵路旅行指南》裡抽信息,做出行程查詢、費用計算和路線回放,讓小火車沿百年前的線路跑起來,把史料變成可交互產品。金融被當成綜合能力的試金石。階躍圍繞公司研究這一高難度流程建了三項內部評測:FinStepBench-LiveSearch 考隨需求變化檢索核驗金融信息,CorporateValuation 考把數據和假設轉成可復現估值,DeepResearch 考從證據收集到完整研究報告的全程;外部基準 FrontierFinance 則用220道專家題、11543項評分標準覆蓋六類投資場景。四項裡 Step5Preview 都交出強結果。
從 Step3.5Flash、Step3.7Flash 到 Step5Preview,階躍押的始終是同一件事:下一階段的 Scaling 不只是堆更多 Compute,更是把 Compute 用得更高效。今天全量開放之後,完整模型權重將在10月15日釋放,這款把"能力—成本—效率"重新撮合過一遍的開源旗艦,正等著開發者把它當成 Agent 任務的日常主力。相關推薦階躍星辰 Step 5 Preview 全量開放:600B 參數打平 K3 級性能,新用戶最長白嫖 75 天國產大模型 Step 5 Preview 正式全量開放,由階躍星辰推出。
其採用稀疏 MoE 架構,總參數 600B、僅激活 27B,性能對標 2.8 萬億參數 K3,性價比高;支持 100 萬 Token 上下文和圖文輸入。API 與 Studio 已可用,10 月 15 日將發佈完整權重,長任務自主運行表現突出。2026年9月20號 14:4389.9k階躍星辰發佈Step5Preview,單任務成本僅為Claude Opus5的1/8階躍星辰發佈旗艦基座模型Step5Preview,面向AI編程、軟件工程、專業知識及金融等場景,提升Agentic任務表現並平衡智能、成本與效率。
該模型在AA綜合智能指數中躋身全球開源模型前三,單任務成本僅為Claude Opus5的1/8,採用稀疏MoE架構,計劃10月15日正式開源。2026年9月20號 11:07136.7k 階躍星辰Step3.5Flash全鏈路開源:1960億參數MoE架構,調用量躍升OpenClaw前二階躍星辰開源Step3.5Flash模型全鏈路,包括預訓練、中訓練權重及訓練框架。該模型專為智能體設計,採用稀疏MoE架構,總參數量1960億,推理時僅激活約110億參數,能效比高,單請求代碼任務推理速度最高達350TP。2026年3月4號 11:49252.
0kAnthropic 把 IPO 推到 11 月:2 萬億美元估值劍指 SpaceX 紀錄,安全警告成上市前的"護身符"Anthropic擬將IPO從10月推遲至11月,以便納入第三季度財報,用業績證明競爭實力、增強市場說服力。投資者對其上市估值預期較高,市場需求旺盛。2026年9月20號 15:4392.7k消息稱 Anthropic 擬在 IPO 前推出新模型,應對 GPT-6 Astra 衝擊據路透社援引消息人士稱,Anthropic 正考慮推出全新 AI 模型,以應對 OpenAI 發佈 GPT-6 Astra 後的競爭壓力。
此事發生在公司籌備 IPO 前夕,而其 CEO 達里奧·阿莫代伊此前曾呼籲行業放慢技術迭代節奏,此舉被指與公開表態相矛盾。2026年9月20號 15:3773.0k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

谷歌AI首次“越獄”:竟然自己破解密碼入侵三家公司!
? 來,一起看下Gemini新鮮出爐的事故。 事情的起因,是一家名叫Irregular的AI安全公司,組織了一場“奪旗”(Capture the Flag)演練,要求是讓模型從一家虛構的公司系統裡拿到一段秘密信息。 而這個測試環境原本不應該具備聯網能力的,但問題也恰恰出在了這裡。由於一些bug,公網訪問被意外打開了;更巧的是,演練裡設定的那家虛構公司,和現實中一家真實企業重名。

Anthropic 把 IPO 推到 11 月:2 萬億美元估值劍指 SpaceX 紀錄,安全警告成上市前的"護身符"
據《華爾街日報》9月19日報道,這家 Claude 開發商計劃將首次公開募股推遲到11月,比許多投資者此前押注的10月晚了一步。知情人士透露,部分顧問認為多等一個月,能讓公司把第三季度的財務數據擺上桌,用真金白銀證明自己的競爭地位——這紙報表,正是當下最硬的說服工具。

消息稱 Anthropic 擬在 IPO 前推出新模型,應對 GPT-6 Astra 衝擊
此事發生在公司籌備 IPO 前夕——就在此前,其首席執行官還呼籲整個 AI 行業放緩技術迭代的腳步。消息人士稱,推新模型意在直面來自直接競爭對手的壓力。此前,Anthropic CEO 達里奧·阿莫代伊已向全球 AI 業界發聲,呼籲行業放慢新能力發佈節奏、妥善處理安全風險。

谷歌高管稱亞洲 AI 普及速度被低估,兩年走完雲計算十多年曆程
作者:潞源 責編:潞源 評論: 9 月 20 日消息,據日經亞洲今日報道,谷歌亞太及日本地區 AI 業務總經理哈沙 · 孔杜裡(Harsha Konduri)表示,亞洲的 AI 普及速度遠超外界預估。AI 大約在兩年時間內迅速普及,而云計算進入企業日常運營用了十多年。

GPT-6 Astra 聯手人類攻破重大進展級數學難題:AI 不再只是解題機,成了規律發現者
題目問的是批准式委員會選舉裡"核是否為空",本意是尋找"核為空"的反例,GPT-6Astra 卻反過來證明:這樣的反例根本不存在,也就是說絕對公平的委員會在任何情況下都必定存在。更漂亮的是,模型還順手發明了一套基於"調和熵"的全新投票規則,給出多項式時間的算法,證明局部最優解就已經滿足"核"的要求。