又快又能打!匿名模型玉兔模型殺上雙榜第一,Coding實測全記錄

2026年9月27日 21:42
又快又能打!匿名模型玉兔模型殺上雙榜第一,Coding實測全記錄
站內 AI 整理稿

說的就是你,Space Bunny。一個沒留神,它在短短幾天裡經歷了突然出現->突然熱度飆升->突然幹到OpenRouter、OpenCode雙榜調用日榜第一->突然討論熱度也飆升。掃了一眼,推特和Reddit上目前的整體風向是這樣的: 有說unbelievable的(be like@CoderGeeta)。不少用戶反饋輸出效果不錯(be like@Fei2411)。還有誇速度快,“打敗了Astra”的(be like@marcthecreatorr)。真的嗎?我不信。所以在迷人又珍貴的中秋假期最後一天,我做了一個違背祖宗的決定——管他是誰家的匿名模型,先測了再說吧。

猜它是誰幹嘛,快開蹬啊 先跟大家說一聲,我是從OpenRouter上拿的API,接到了DeepSeek Harness(為公平起見我用了之前我沒用過的DSH,慚愧)裡面,給Space Bunny隨便取了個名字叫“tuerye”。昨晚上和今天上午都在使勁蹬,然後隨機抽取,最後放了4個case在這篇稿子裡。可能附帶一些我自己的個人主觀彈幕,但主要還是為了呈現。歡迎大家給自己的判斷。我這個人吧有點執念,這個世界上的匿名模型,管他大王小王,通通都要給我拉來測coding能力。最近最火的除了Astra操控Blender,還有的就是3D玩法了。那就上強度吧,我讓它“用Three.

js構建一個詳細的立方體風格天壇,包含交互式細節”。任務一開始跑我就擱旁邊看《花少2》8小時版本去了……大概一個多小時不到兩個小時吧,想起來看了一眼居然就跑完了,比我預想中快很多。效果見視頻: 我給編輯部幾位同事看了下,滿足“交互”這個條件就不說了,它自己加了些我壓根兒沒提的細節,比如底部控制條裡還有夜、黎明、正午三個時刻和雨、煙的天氣開關;晝夜還會自行循環,一天約3.5分鐘,時辰文字也隨時間從子時走到亥時。反正總體而言大家都覺得Space Bunny的初戰效果比較令人滿意。而且說出來都丟臉,做完了我才想起來DSH它,沒!長!眼!睛!所以評分方面再給這兔子加一顆星,表達我的歉意。。。

OK,展示第二個任務,給咱做一個蘋果系統的、更適合中國寶寶體質的鬧鐘。這個功能其實iOS 27說是有了,但身在中秋假期在這兒為愛測評的我,腦子裡啪一下就冒出了這個需求。Space Bunny耗時共22分鐘46秒。做出來的鬧鐘,響鈴時的界面是這樣的,霸佔整個Mac的屏幕。很霸道但也很簡潔: 一輪跑出來界面是這樣的: 按理說一輪就夠用,但我還是又讓它加個每個月到底鬧鈴響不響的功能,起床時間也調到7:23。我們早八人是這樣的,能多睡一分鐘就儘量多睡一分鐘。。。這任務吧實用性比較強,咱們主要來看看readme裡面它記錄的思考。iOS的硬性限制它也考慮到了: 但你們要不要看下我在這裡看到了什麼。。。

這是什麼。。。暈倒了我已經。怕自己貼截圖的時候再次暈倒,所以趕緊來看第三個Coding任務吧,讓Space Bunny做個App。“做一個mac app,把dsh當前的思考像字幕一樣打在屏幕上。” 好消息是這玩意兒做起來就很快,可能不到5分鐘?我在飛書頁面寫這篇稿子呢,非常短的時間裡屏幕上就冒出來了個這個,給我嚇一跳。壞消息是這次它自己腦補的細節就沒有天壇那個豐富,初次交差的版本確實一直在顯示DSH的腦回路,但窗口不能拖動挪動,也沒有關掉和最小化。

這個位置一度擋住了我和DSH的對話框,我沉默許久,終於想起來可以給窗口縮小咯(可能是還沉浸在中秋尾聲,今天測試的諸多環節我好像都失了智,好在Space Bunny智商還挺在線的)。但我還是無能地勃然小怒了一下: 不到15分鐘,且是在我開了多個任務同時跑的前提下,它給改好了。現在就是隨便挪,任意挪,想咋挪就咋挪。而且沒有思考的時候它會變得小小隻。我覺得海星?還不錯!不過也有兩個問題。一個是它自己說的,“合成鼠標事件在這個環境裡會被系統丟掉一部分,所以「拖動是否與指針1:1同步」我沒法在無頭環境裡斷言——我改成了直接跟指針的屏幕位移(兩端都是AppKit座標,不存在符號翻轉),你手動拖一下最準。

” 另外就是拖動的時候會像小星星一樣一閃一閃的?這個不是啥大問題,應該就是因為實時顯示腦回路所以窗口忽大忽小的,我又在拿鼠標拖拽,兩套操作有點打架。回頭再交互一輪簡單打磨下就好了。講真最近測的好幾個模型都這樣,首輪出來總會有些小細節有bug,肯定是沒有Astra這種驚豔你一跳又一跳的feel,但拿來幹活跑跑代碼肯定是沒問題的。也就是首輪結果出來過後自己要再手動提點小建議,一般一輪就能解決。如果要增加新功能就再交互再跑。Reddit上有老哥跟我體感是一樣的: 我測試過程中幾乎沒有出現一輪解決不了的問題。

只有一次,跑了個“給GitHub某倉庫的文章列表增加cursor分頁和標籤組合篩選,補全測試且保持舊接口可用”的任務,看到它聲稱“全部檢查通過”,隨後又說明lint仍有33個錯誤,有點bug。但這個問題一說也馬上就改了,我還讓codex幫我審了一遍,人家也說沒問題。前前後後測了十幾個coding任務都給我測累了,於是我的魔爪又伸向了多模態。丟給它一個特斯拉擎天柱吧檯優雅營業的視頻,就是這個: △視頻來源𝕏@cbdoge 問Space Bunny(寫到這裡我腦子裡有一瞬間無理由飄過“這兔子不會是Grok吧”): 這個機器人幹嘛呢?

中間流程太複雜了,直接上最終結果: 講道理這個任務不知道為什麼緩存命中有點低?我看了下,除了這個任務其餘的緩存命率中都在95%以上⬇️ 太空玉兔,你是O/A/G/Z/M/K…家的嗎?講真,我是測完過後才開始認真去看開發者們分享的一手體感的。好的壞的評價都有,初步目測是好評偏多。什麼說Space Bunny是個工具狂人啊: 速度快啊: (好,原來大家都用GPT-6審代碼,本菜狗放心了) 別慌,當然不可能全網好評!也有說它思考得太多——這和第一個測試中它給的天壇的結果比prompt豐富得多對應上了。但也要和大家李濤一下,速度快、最終結果ok,還能給出更多的信息量…… 那麼思考太多到底算好算壞呢?

Anyway。如果你有自己的體會也歡迎分享在評論區,我們會在第一時間把留言放出來。好,最後還是俗氣地來到傳統習俗——猜廠商——環節。雖然說,現在每個月都有新匿名模型,已經快成模型發佈固定伴侶了…… 但因為使用體感沒有拉胯,猜一猜也行吧!我看網友們的猜測都五花八門的。有網友說,因為聲音聽起來和GPT的很像,所以OpenAI你別藏著掖著了,直接亮相吧小寶貝: 居然還看到有人跟我前面一樣,從名字裡的“space”來粗暴猜測,說Bunny同學就是Grok的船新版本。xswl,謝謝兄弟姐妹告訴我這麼神經的人不只有我一個。

然後國內頭部模型們幾乎都被猜了,猜Kimi的、GLM的、HY的、MiniMax的都有。還有人覺得是Meta接下來會發布的Muse Spark。先不說猜得對不對的,但猜想小扎看到這個猜測一定很欣慰,我們Meta也是真的靠Muse重新上桌了嗚嗚嗚。放幾個月前,這種表現不錯的匿名模型,誰會把Meta的模型拿出來說啊喂!最後的最後,我俗氣地和大家感慨一下,比起認領兔子更值得關注的應該是Space Bunny這麼快在調用榜登頂的實質原因。現在日常幹活,除了搞算法的朋友們,大家的大模型挑選標準都趨向經濟適用。吾日三省吾身:這模型快不?準不?貴不?

正因如此,幾乎所有的Flash高速模型就成了處理高頻任務的主力工具。就目前的信息而言,Space Bunny大概率也是想這樣走花路的,不過,具體定價還是要等廠商認領公佈咱們才知道了╮(╯▽╰)╭ 參考鏈接: [1]https://x.com/Fei2411/status/2104030913814515932 [2]https://x.com/CoderGeeta [3]https://www.reddit.com/r/opencode/comments/1wocn5s/spacebunnythoughts/ [4]https://OpenRouter.

ai/rankings#natural-languages [5]https://x.com/cbdoge/status/2032939247443882115?s=20 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

量子位模型更新

量子計算走上桌面!“小盒子”跑通端到端,數據全程不出門

酉術量子發布全球首個異構計算硬件底座UnitarySpark,並上線以自然語言驅動的量子科學計算平台UnitaryLab 2.5公測版。該平台旨在降低量子計算的使用門檻,讓開發者能用大白話描述科學問題,由機器自動完成量子與經典算力的協同運算,無需自行撰寫量子程式或處理數據上雲的合規問題。

剛剛
MarkTechPost AI模型更新

Sarvam AI 推出 Saaras V4:涵蓋印度 22 種語言與全球英語的語音轉文字模型

Sarvam AI 已發布 Saaras V4,為其最新一代語音辨識模型,涵蓋印度憲法附表所列全部 22 種語言,並加入包含全球英語口音的英語支援。Sarvam 表示,該模型在全部 22 種語言上均達到了最先進的精確度。能否直接部署?可以,現在即可透過 Sarvam 的 API 使用 model="saaras:v4" 呼叫。

17 小時前
量子位模型更新

索辰科技加碼世界模型,與戰略投資企業美夢空間聯合發佈具身模型與物理測評標準

索辰科技投資的美夢空間在數貿會上發布具物理感知能力的Physical-WAM世界動作模型及RoboTwin-Phys物理漂移評測基準,旨在解決現行VLA模型缺乏物理理解、實際操作成功率低的問題。Physical-WAM透過物理Token與三大模塊讓機器人預判與修正動作,RoboTwin-Phys則提供可控的物理擾動評測標準,且已開源,希望加速具身智能產業落地。

19 小時前
MarkTechPost AI模型更新

Supersonic Labs 推出 Julia 1:一個 1.443 億參數、可在 CPU 上運行的開放決策模型

Supersonic Labs 是一家來自巴西的小型 AI 實驗室,近日發布了 Julia 1。它是一個輕量級決策模型,而非聊天機器人。你只需提供上下文、問題,以及 2 到 20 個候選答案,它便會選出一個答案,並回傳每個選項的機率。該模型擁有 1.443 億個參數,可以在一般 CPU 上運行。它能部署嗎?可以。權重已以 Apache 2.0 授權釋出於 Hugging Face,可在 CPU 或支援 BF16 的 GPU 上以 Python 3.11+ 本機執行;ONNX 版本亦可透過 WebGPU 在瀏覽器中運行。官方也宣佈了託管 API,但目前尚未開放。Julia 1 的功能:Julia 1 透過單一 API 處理三種決策類型——choice:從 2 到 20 個描述的選項中挑出一個標籤(分類、路由);score:依有序評分標準回傳預期索引,例如低、中、高;bool:回傳是或否的機率。

19 小時前
MarkTechPost AI模型更新

Liquid AI 推出 LFM2.5-VL-3B-DSpark:推測解碼加速視覺語言模型,最高提升 3.13 倍

Liquid AI 發布 LFM2.5-VL-3B-DSpark,這是針對其 LFM2.5-VL-3B 視覺語言模型所設計的實驗性推測解碼草稿模型。該草稿模型約增加 2.8 億個參數,在不改變模型輸出的前提下加快解碼速度。官方數據顯示,在 Apple 晶片上解碼速度最高提升 3.13 倍,在 NVIDIA H100 上則最高提升 2.66 倍。此模型已可部署,權重以 Safetensors 與 GGUF 格式發布於 Hugging Face,並支援 SGLang、MLX-VLM 與 llama.cpp。Liquid AI 團隊將其標註為實驗性版本,採用 LFM 開放授權 v1.0,僅允許年營收低於 1000 萬美元的公司免費商用。推測解碼的原理是:標準模型每次前向傳播僅生成一個 token,而此技術加入一個小型草擬模型,以加速整個生成流程。

1 天前
IT之家模型更新

德國柏林警方藉助人工智能監控攝像頭打擊犯罪,自動識別暴力和破壞行為

作者:浩渺 責編:浩渺 評論: 9 月 25 日消息,據央視新聞報道,德國柏林警方 24 日在一處犯罪高發區域啟動一項計劃,將藉助人工智能監控攝像頭打擊犯罪。據悉,柏林警方將在這項計劃啟動的前四周內,在科特布斯門地區安裝並調試好人工智能監控攝像頭,隨後正式投入使用。

1 天前