階躍新旗艦 Step 5 Preview 發佈,躋身 AA 榜單全球開源前三

2026年9月20日 02:20
站內 AI 整理稿

9 月 20 日,階躍星辰發佈新一代旗艦基座模型 Step 5 Preview,重點面向 AI 編程、軟件工程、專業知識工作、金融等場景,提升模型在真實世界 Agentic 任務中的綜合表現,並進一步拓展智能與成本之間的最優邊界。在最新的全球權威榜單 Artificial Analysis Intelligence Index(AA 綜合智能指數)中,階躍 Step 5 Preview 躋身全球開源前三。值得關注的是,該模型單任務成本僅為Claude Opus 5 的 1/8。據官方透露,該模型將於 10 月 15 日正式開源。

Step 5 Preview 採用稀疏 MoE 架構,總參數量 600B、激活參數僅 27B,支持 100 萬 Token 上下文窗口,原生支持文本與視覺輸入,在軟件工程、專業工作流和金融等場景表現突出。在能力、成本、效率與場景覆蓋之間尋求最大化平衡,是 Step 5 Preview 的核心賣點。模型面向真實世界的智能體任務,其定位是可持續處理複雜任務的主力工作模型。在能力與成本的權衡中,常用“帕累託前沿”描述當前能夠達到的最優邊界。前沿越向外推,意味著同樣的成本可以買到更強的智能。

而 Step 5 Preview 將 Intelligence Index 與單任務成本之間的平衡進一步逼近更優解。在公開和內部評估中,Step 5 Preview 在複雜的軟件工程任務(包括長期規劃任務)以及專業知識工作和金融領域的基準測試中均表現出色。階躍認為,過去大模型 Scaling 的核心,是用更多計算換取更強智能;但隨著模型規模擴大、智能體任務複雜度提升,計算成本也在快速攀升。因此下一階段模型 Scaling 的關鍵,是提升計算轉化為智能的效率。從 Step 3.5 Flash、Step 3.

7 Flash 到 Step 5 Preview,階躍連續三代基座模型都延續了對這一問題的探索。

Related

相關文章

B站上線"AI 無限競技場"測評榜:上百模型同場廝殺,GPT-6 暫坐頭把交椅

AI資訊AI新聞資訊正文B站上線"AI 無限競技場"測評榜:上百模型同場廝殺,GPT-6 暫坐頭把交椅發佈於AI新聞資訊發佈時間 :2026年9月20號 14:13閱讀 :1分鐘B站今天端出了一塊大模型擂臺——"AI 無限競技場"測評榜,並同步亮出首輪排行榜。在10位 UP 主的真機實測裡,GPT-6Astra 拿下榜首、並且搶下"登頂次數冠軍",把 GLM-5.3壓在身後;前五名裡國產大模型佔了三席,和海外巨頭貼身肉搏。這塊競技場和傳統跑分榜的玩法不一樣。它把 B站 各領域 UP 主對上百個大模型的真實場景實測匯成一個廣場,涵蓋代碼、推理、協作、知識等多種主題,而且不設固定的測評維度限制——來自不同分區的創作者拿真實工作流、專業應用乃至趣味腦洞自主命題,讓模型在同題 PK 裡把實際差距攤開給人看。DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千問、Hy、MiniMax 等主流模型都在對比之列,排名實時刷新,並持續向全站 UP 主開放報名。B站 押注這塊榜單,底氣來自平臺上 AI 內容的爆發。過去一年,B站 AI 知識內容消費時長同比增長72%,月均觀看 AI 內容的用戶超過1.9億,圍繞模型發佈、討論、測評、使用、求助、共建的內容已經成體系。當模型迭代快到跑分榜追不過發佈節奏,把評測權交還給真實創作者和真實工作流,反而更貼近用戶心裡那句"到底哪個好用"——B站 想做的,是把自家的社區生態變成大模型走向大眾的另類裁判臺。相關推薦 Anthropic考慮推出新模型,擬應對OpenAI GPT-6Astra競爭路透社稱,Anthropic籌備IPO期間擬推新AI模型,以應對OpenAI GPT-6Astra在企業市場的競爭,但安全性仍在評估,發佈時間未定。此舉與其CEO阿莫代9月12日呼籲放緩AI能力迭代、重視安全的主張形成對照。2026年9月2

剛剛

啟元機器人接入騰訊雲WorkBuddy,AI首次從屏幕"走"進物理世界

AI資訊AI新聞資訊正文啟元機器人接入騰訊雲WorkBuddy,AI首次從屏幕"走"進物理世界發佈於AI新聞資訊發佈時間 :2026年9月20號 13:52閱讀 :1分鐘9月20日,消費級具身智能品牌「啟元機器人」宣佈與騰訊雲達成合作,啟元Q1、T1機器人正式接入WorkBuddy,成為首個接入WorkBuddy的具身智能企業。這意味著WorkBuddy首次實現"具身化"——從屏幕裡的AI助手,變成有耳朵、眼睛和手腳的物理實體。雙方的分工清晰明確:WorkBuddy充當"大腦",負責理解、推理和調度雲端數萬個生態Skill;啟元機器人充當"身體",負責交互和執行,已沉澱上百種具身智能原子能力。在辦公場景中,WorkBuddy可調度機器人到工位物理提醒員工參會,並領路帶至對應會議室;會議結束前,機器人還能舉手示意並語音播報。在家庭場景中,用戶可通過WorkBuddy遠程向機器人下達指令,如"給寶寶講一個恐龍故事",機器人會配合手勢和表情完成互動。為保障安全,雙方構建了四層防線:連接權限管控、動作白名單校驗、仿真預覽和現場二次確認,確保每一次物理動作都安全可控。隨著WorkBuddy開放平臺正式上線,未來更多開發者與硬件廠商的加入,將推動具身智能加速走進職場與生活。相關推薦WorkBuddy 升級 PPT 能力:一句話生成可上臺版,原文件可續改騰訊WorkBuddy於9月14日升級PPT生成:支持一句話出初稿、基於原文件續改、無需整份重做。用戶可在對話框輸入指令或點擊“幻燈片”、調用“/tencent-pptx”技能。材料不全時,僅提供主題和頁數,系統會補問彙報對象、場景與目標,並按“問題—論證—結論—落地”主線生成;也可傳入調研報告等資料。2026年9月14號 17:48369.0k具身智能的“ChatGPT時刻”何時到來?百億具身CEO與青年創業者外灘大會熱議9月11日外灘

剛剛

DeepSeek明確調休日計費規則,中秋國慶迎來十天"半價窗口"

AI資訊AI新聞資訊正文DeepSeek明確調休日計費規則,中秋國慶迎來十天"半價窗口"發佈於AI新聞資訊發佈時間 :2026年9月20號 13:55閱讀 :1分鐘9月19日,DeepSeek正式發佈API峰谷時間補充說明,明確調休上班的週末以及中國法定節假日全天,均按空閒時段計費。這意味著,9月20日(週日調休上班)、10月10日(週六調休上班)以及中秋、國慶假期,開發者均可享受低谷價格調用API。根據DeepSeek此前公佈的峰谷定價機制,工作日高峰時段(9:00-12:00、14:00-18:00)價格為低谷時段的兩倍,而週末全天統一按低谷價計費。此次補充說明進一步堵上了"調休日算工作日還是週末"的模糊地帶,明確只要是週末,就按空閒價執行。按此規則,從9月20日到10月10日,DeepSeek將迎來一段超長優惠期:中秋三天(9月25日-27日)、國慶七天(10月1日-7日),加上兩個調休週末,累計超過十天全部按空閒時段結算,堪稱全年"半價日"最密集的時段。與此同時,DeepSeek於9月10日發佈的V4.1Flash模型也進一步拉高了性價比。這款552B參數的MoE模型採用非對稱架構,輸入僅激活8B參數、輸出激活16B,在多項基準測試中性能反超自家旗艦V4Pro,價格卻按Flash檔位定價。空閒時段下,V4.1Flash的緩存命中輸入低至0.02元/百萬Token,輸出僅4元/百萬Token。有開發者調侃:"這感覺就像回到了DeepSeek漲價前。"對於高頻調用API的團隊來說,接下來的十天,確實是"放心使勁蹬"的好時候。相關推薦爆料稱 DeepSeek 下一波大模型將至:3 萬億參數,性能劍指 GPT-6 AstraDeepSeek本週發佈V4.1 Flash,架構變化巨大但未升大版本號。V4.1 Pro已確定,具體升級未公佈,性能上限或較高,但鑑於前代Pro不及預

剛剛
IT之家生成式AI

B站上線“AI 無限競技場”LLM 測評榜:號稱“全球百大模型同場競技”、GPT-6 現居榜首

首頁 > 智能時代>人工智能 B站上線“AI 無限競技場”LLM 測評榜:號稱“全球百大模型同場競技”、GPT-6 現居榜首 2026/9/20 13:46:36 來源:IT之家 作者:漾仔 責編:漾仔 評論: IT之家 9 月 20 日消息,B站宣佈上線“AI 無限競技場”大模型測評榜,同步公佈了首輪模型排行榜,其中 GPT-6 Astra 在 10 個 UP 主測評中拿下榜首,打敗 GLM-5.3 獲得榜首次數冠軍;前五名中,國產大模型佔據三席。IT之家附榜單地址(https://www.bilibili.com/blackboard/era/aiarena.html?bsource=market_aiarena_sns_02)。據B站介紹,“AI 無限競技場”是一個彙集了B站 UP 主 AI 大模型測評的競技廣場,由各領域 UP 主對上百個大模型的真實場景實測構成,涵蓋代碼、推理、協作、知識等多種測評主題。不同於傳統跑分評測,B站 AI 無限競技場不設主題或測評維度限制,來自各個分區的 UP 主們以真實工作流、專業應用、趣味腦洞等自主命題,在同題 PK 中直觀呈現各模型的實際表現差異。榜單涵蓋 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千問、Hy、MiniMax 等主流模型對比測評,排名實時更新,持續面向全站 UP 主開放報名。公開信息顯示,過去一年B站 AI 知識內容消費時長同比增長 72%,月均觀看 AI 內容的用戶超過 1.9 億。平臺湧現出大量各個領域、維度、主題的測評內容,覆蓋從發佈到用戶討論、測評、使用、求助、共建等領域。廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家包含外鏈的文章均包含本聲明。 投訴水文 我要糾錯 下載IT之家APP,簽到

剛剛