開源Top2!實測階躍Step 5 Preview,真有點猛啊…

2026年9月21日 11:47
開源Top2!實測階躍Step 5 Preview,真有點猛啊…
站內 AI 整理稿

昨天,階躍星辰毫無預兆地端出了最新一代旗艦基座模型——Step 5 Preview。MoE架構,600B總參數、激活參數僅27B,1M上下文。Agent能力大幅提升,在Artificial Analysis的最新評測中,Step 5 Preview取得44分,直接衝到全球開源Top 2。要知道,其他拿到這一分數的大模型,大多都是萬億參數級別。所以相比起來,階躍這個新模型定價蠻便宜。百萬輸入:1美元 百萬輸出:2.7美元 可以說很有競爭力了,單個任務成本僅為Opus 5的12.5%。下面這張圖更加直觀。

AA榜單中,Step 5 Preview位於Intelligence Index與單任務成本權衡的「帕累託前沿」。說實話,看到這個消息時我有點意外。階躍挺久沒出現在這麼靠前的位置了,之前兩代模型都聚焦在Flash這個檔位。但Benchmark這東西嘛,現在大家也都懂。榜單上你追我趕,今天刷掉一個,明天又冒出來一個。真到要用的時候,模型到底行不行,完全是另外一碼事。所以我幹了一件比較費錢的事: 燒了無數Token,並行跑了無數個3D資產、3D遊戲…… 然後,我發現—— 這模型好像還真可以啊。。。一手實測 最近Astra操控軟件不是很火嗎?

所以API一接上,我直接給Step 5 Preview上強度,讓它操作Blender,給我建一個後室出來。說實話,最開始我沒指望它真能交付出什麼東西。結果等它自己折騰了一個多小時,我打開文件夾,再點開渲染好的MP4,直接看愣了。不er,這啥啊,你擱哪個網站下載的視頻??建模本身就不說了,離譜的是,它居然自己給視頻加了一堆後期。VHS錄像質感、鏡頭噪點、昏黃燈光,人物走路的時候甚至還有腳步聲。給我看得有點毛骨悚然了,感覺轉角會跳出一個《痴迷》女主。。。所以咱還是做點老少皆宜的demo吧。第二個任務,我讓它照著1999年的《LEGO Racers》,直接搓一個樂高賽車遊戲。這次也挺完整。

賽道、賽車、人機車手、實時排名都有,甚至連發動機音效都給配上了。也是給我玩得不亦樂乎。唯一的問題是,這賽道修得也太窄了。。。也可能主要還是因為我車技菜,經常一腳油門直接創路障上,有時候甚至連人機都跑不過。不過吧,家人們,玩完兩個3D Demo,我是真有點頂不住了。你要知道,我是暈3D的。前面兩個任務搓完,差點沒擱工位上吐出來。。。最後再奉上一個《花屋》建模,接下來咱還是做點簡單的2D任務吧。先做了個霓虹跑酷小遊戲。有意思的是,我專門用了和階躍上一代官網Demo類似的Prompt。結果差距還是挺明顯的。

道路兩旁加了高樓,視覺層次更完整,Game Over之後整個邊框還會跟著變紅,很多Prompt裡沒寫的小細節,它自己補上了。然後我又讓它做了個寫作網站。這裡必須單獨表揚一句。終於不往東坡肉裡塞番茄炒蛋了。淚目。這審美真可以啊,而且覆蓋面特別全,基本能直接拿來用了。不過,有時候還是會出現模塊溢出這種小Bug,依然得review,依然得改。前面幾個Demo也是這樣。第一輪經常有些小細節不到位,離Astra那種「我咧個,這是AI做的?」的癱軟程度,肯定還有差距。但還是能拿來幹活的。通常指出兩三輪問題,它自己修一遍,就能到可用狀態。那麼問題來了。

明明前面兩代還都是Flash,怎麼到Step 5 Preview,Agent能力突然猛了這麼多?把算力花在刀刃上 過去幾年,大模型行業最簡單粗暴的信仰一直是Scaling。更多參數,更多數據,更多算力。確實很猛,Fable直接給Agent堆超模了,湧現出不少新技能點。但問題也很明顯—— 貴啊。。。所以,Step 5 Preview當然也在Scaling,但它沒有把「越大越好」當成唯一目標。團隊選擇了一種叫Narrow but Deep的網絡設計。直譯過來就是: 窄,但深。92層的Transformer,在控制激活規模的同時,讓信息經過更多層連續變換。這對Agent尤其重要。

複雜任務裡,經常會有大量multi-hop依賴,前面搜到的信息,要經過很多步之後才能真正派上用場。網絡更深,相當於給這些信息留下了更長的傳播和推理路徑。但Agent還有另一個麻煩—— Context。幾十輪工具調用之後,上下文能輕鬆滾到上百萬Token。如果每一層都把前面所有內容重新掃一遍,計算量很快就會爆炸。所以團隊做的第二件事,就是稀疏化。Sparse MoE、Hybrid Sparse、Sparse GQA……本質上都是在解決上下文的問題。當然,算法層面寫個Sparse,不代表GPU真的就會少幹活。索引、訪存、調度這些問題處理不好,好不容易省下來的算力,全部會浪費掉。

這還稀疏個啥,稀疏不了一點。所以Step 5 Preview在硬件上也下了不少功夫,通過底層算子和數據訪問優化,讓理論上的Sparse儘量真正變成實際吞吐。有了這套軟硬件基座,後面要做的事就比較清晰了,圍繞Agent訓一遍模型,讓它能連續幹活。簡單來說,如果以前模型的基本單位是「回答」,那現在就變成了「Loop」。規劃、執行、調用工具、看結果、發現不對、繼續修。然後再Loop。最終,通過Long-horizon RL、Context Compaction等方法,團隊讓Step 5 Preview在幾十輪工具調用之後,還能記得自己到底要幹嘛。

到這裡,Step 5 Preview的思路就比較完整了。踩在「性能×成本」的甜蜜點上,把有限的計算預算儘量花在真正影響Agent能力的地方。這也算是階躍一直以來最擅長的事情。從Step 3.5 Flash,到Step 3.7 Flash,再到今天的Step 5 Preview,路線其實沒怎麼變—— 儘可能讓Frontier級能力,大家用得起。階躍,回來了 大模型競賽打到今天,依舊天上一天地上一年,戰場始終瞬息萬變,唯一不變的共識是: Frontier,遠沒有到終局。畢竟,僅僅過去一年裡,頭部模型的王座就不知道換多少次了。。。

新的模型、新的技術路線不斷把能力邊界往前推,曾經足以建立巨大壁壘的領先優勢,很多時候幾個月就會被追平。Stanford 2026 AI Index裡有個數據很有意思。截至2026年3月,Anthropic、xAI、Google和OpenAI四家公司最頂尖的模型,在Arena上的差距已經壓縮到了25個Elo以內。你要知道,GPT剛發的時候,這個差距可遠沒有這麼小。大模型競爭正在進入全新階段: 一方面,Frontier的門檻越來越高;另一方面,Frontier內部又越來越擁擠。單純追逐某一個Benchmark、某一次榜單第一,已經很難定義一家模型公司的長期位置。

今天一個模型需要回答的問題,是更復雜的: 能力有沒有什麼差異化?成本能不能壓下來?Benchmark上的智能,又能不能真正遷移到複雜、開放、長程的真實任務裡?現在各家其實都已經開始瘋狂點自己的技能樹了。K3專攻前端開發,將網頁設計做到極致。V4 Flash打爆性價比,給Flash級模型幹成白菜價。Astra同樣如此,Coding其實沒提升多少,但把Computer use的心智站住了。大家都在尋找自己的那根長板。這次,階躍也給出了他們的答案。向上,發佈旗艦基座,殺回全球第一梯隊。向下,優化效率和成本,讓Agent真正進入大眾生活。大時代啊朋友們。

說實話,這才是AI行業最有意思的地方,要是真靠Scaling解決一切,跟製造業有啥區別啊。我一直覺得,模型層更像是一片參差不齊的竹林。點亮任何一個技能點,都意味著Trade-off。更強的推理、更長的Context、更低的延遲、更少的激活、更強的多模態、更好的Agent能力…… 至少在相當長的一段時間裡,很難有一家模型把所有方向全部點滿。所以技術路線也不會這麼快收斂。只要能找到合適的切口,總會有新模型、新公司的市場生態位。關於AGI的這場馬拉松,遠沒有跑到最後一公里。階躍,回來了。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭

最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。

剛剛
鈦媒體生成式AI

最火啞巴模型Jev加上微信,直接治好了我的低情商

字母AI2026.09.21 11:44 · 來自北京全文3770字00:00 / 10:28Jev微信插件爆火,根據對方消息直接揣測對方想法。文 | 字母AI谷歌的啞巴模型Jev突然爆火。它不聊天,不寫代碼,不寫文案,也不解釋,你問它什麼,它一個字都不生成。它只做一件事——判斷。發佈沒幾天,從Hacker News,再到中文技術社區,幾乎所有人都在討論它。但大家討論的不是它有多聰明,而是它有多反常。誠然,一個不會說話的模型能火,這事本身就已經夠反常的了。大家最先討論的,是它的落地場景。

剛剛

特斯拉得州超級工廠鋼結構接近完工,Optimus產線建設加速

X平臺博主Joe Tegtmeyer近期通過無人機拍攝顯示,工廠主體鋼結構已接近建築北側邊緣,距離北側外圍梁約剩5個柱網;廠房上方三層結構正在進行混凝土澆築,其他區域也在持續進行澆築準備工作。Tegtmeyer認為,特斯拉得州Optimus工廠規劃年產能達1000萬臺,預計生產工作將在2027年晚些時候啟動。

剛剛

微軟Copilot桌面版新增內置瀏覽器,支持多標籤與全屏瀏覽

目前該功能已面向管理員開放測試,但需通過設備管理系統啟用BrowsingEnabled策略,更廣泛的自動推廣預計將在11月底進行。微軟表示,9月21日還將發佈補充更新,為側邊欄網頁標籤增加右鍵菜單,可直接選擇在外部瀏覽器中打開鏈接。此前用戶點擊Copilot回答中的參考鏈接通常需要跳轉至外部瀏覽器,新功能則允許網頁直接加載在Copilot內部,關閉頁面後即可繼續對話。

剛剛