美團萬億模型悄悄上線,我用它復刻了Muse前端
作者 | 江宇 編輯 | 心緣 9月30日報道,9月25日,美團LongCat團隊上線了新一代預覽版模型LongCat-2.5-Preview,並在OpenCode開放了為期兩週的限時免費體驗。具體能力如何?我們將LongCat-2.5-Preview接入Claude Code,連續測試了三個Coding任務:復刻Meta Muse App、製作SpaceX星艦升空動畫,以及開發一款3D賽車遊戲。從整體體驗來看,一句話概括:能用、夠省,但還不夠快。該模型總參數達到1.
6萬億,每次推理激活約480億參數,支持100萬Token上下文窗口和原生多模態能力,主要面向長週期任務,可操作終端、瀏覽器、GUI、電子表格和設計工具等。值得一提的是,上一代LongCat-2.0是在國產算力集群上完成大規模訓練的,並實現萬億參數MoE模型的穩定訓練與推理。回到模型價格,LongCat API開放平臺新用戶完成實名認證後,可免費領取1000萬Token。目前LongCat平臺還提供5000萬Token新手資源包,售價9.9元,均可用於LongCat-2.0和LongCat-2.5-Preview。LongCat-2.
5-Preview API也在進行限時折扣:緩存未命中的輸入價格由5元/百萬Token降至2元,緩存命中輸入由0.1元降至0.04元,輸出由20元降至8元。我們最初在OpenCode體驗時,由於用戶較多,模型一度無法及時響應。OpenCode評論區中也已經出現首批開發者“省流”測試案例,比如讓模型製作“鵜鶘騎自行車”的動畫,成品存在一些動作與姿勢的細節問題。因此,我們隨後改用API,將LongCat-2.5-Preview接入Claude Code繼續測試。面對連續、多步驟的Coding任務,它的實際表現究竟如何?下面直接看實測。
一、復刻現象級App Muse,核心交互基本跑通 首先,我們復刻了一款近期走紅的App——Meta Muse。Muse上線後僅10天便登頂美國App Store免費應用總榜,一度超過ChatGPT。▲Muse實機界面(圖源:APP Store) 其產品設計同樣有辨識度:整個界面保持極簡聊天形態,Agent執行瀏覽網頁、填寫文件、付款審批等任務時,相關結果會直接以卡片形式嵌入聊天流中。
我們因此要求LongCat參考Muse界面,復刻其主要視覺和交互邏輯,包括Chat、Ideas、Goals、Connectors等頁面,以及Browser Card、File Card、Approval Card等組件,並完整跑通一次電影票預訂流程。從最終效果看,Muse實機畫面中的主要設計元素基本得到保留。頂部是居中的Agent頭像,左側為菜單按鈕;聊天區域採用灰色AI氣泡和淺藍色用戶氣泡;Browser Card、文件卡片和支付確認卡片均直接嵌入對話中,底部則保留極簡輸入框。不僅視覺結構較為接近,幾個主要頁面也可以實際切換。
在電影票實驗,用戶確定場次後,聊天流會出現選座Browser Card,隨後進入支付確認步驟;點擊Allow後,Agent繼續返回訂票結果。整個流程都在同一聊天界面內完成,與Muse的主要交互邏輯基本一致。不過,這項任務的思考時間較長。其中一次連續思考時間達到約10分鐘,整個項目最終完成耗時也超過30分鐘。二、代碼模擬星艦升空,主要動態效果均有實現 第二個任務,選擇了剛剛發生的事件。近日,SpaceX第14次星艦試飛從美國得州Starbase基地點火升空。我們要求LongCat使用前端代碼製作一個實時運行的星艦發射動畫,不調用MP4、GIF或預渲染視頻,主要通過Three.
js、WebGL、Shader和粒子系統完成火箭、噴流、煙霧、動態光照和鏡頭運動。最終項目中,LongCat用程序化幾何體搭建了Starship和Super Heavy,並加入發射塔、發射臺和地面設施。發動機部分使用多個噴流源模擬發動機集群,同時加入火焰;煙霧則分成白色蒸汽、灰色煙霧和貼近地面的塵土三層。項目還實現了動態光照、Camera Shake、鏡頭上仰、衝擊波以及發射狀態UI等效果。火箭先在發射臺保持靜止,隨後點火、產生煙霧並緩慢離開發射臺,之後逐漸加速,鏡頭同步向上抬升。從最終畫面來看,火箭、發射塔、尾焰、煙霧和鏡頭跟隨等核心元素都已經具備,能夠完整實現一次星艦點火升空過程。
不過與我預期的視覺效果相比,最終成品在場景豐富度、煙霧層次和3D材質細節上仍有提升空間。三、搭建3D賽車Demo,競速玩法完整落地 第三個任務,我們讓LongCat製作一款可以實際遊玩的3D賽車遊戲Demo。提示詞要求項目具備3圈比賽、3輛AI賽車、WASD控制、漂移、氮氣、碰撞反饋和Checkpoint機制,同時加入排名、速度、圈數、計時器等遊戲UI。最終Demo已經可以實際運行。玩家可以控制賽車完成加速、剎車和轉向,AI車輛也能夠沿賽道參與比賽;漂移、氮氣、圈數、排名以及計時等基礎機制均有實現。主觀體驗上,這一任務中LongCat-2.
5-Preview的速度與完成度低於我們此前體驗的DeepSeek-V4.1-Flash,高於MiMo-V2.6。試玩過程中,我們發現了一個控制問題:按D鍵時,賽車實際向左轉。LongCat隨後檢查代碼,將問題定位到Three.js座標系與車輛朝向之間的關係,並耗時3分鐘修改了steer的符號邏輯。除此以外,賽道本身也相對簡單。實際體驗中,彎道較多,直道、坡道等路況的區分並不明顯。結語:國模牌桌再添一員,LongCat存在感上來了 三項測試中,LongCat-2.5-Preview都完成了可實際運行的項目。當天共使用798.56萬Token,由於緩存命中不計入資源包消耗,實際扣除約78.
98萬Token。按照當前1000萬Token免費用的新手禮包,價格優勢比較明顯。速度方面,三個任務耗時均超過30分鐘。相比國內頭部模型,LongCat此前的市場聲量並不算高。但這次預覽版不僅保留了原生多模態能力,在Coding和長任務執行上也已經展現出較完整的能力。國產模型的競爭正在從參數、榜單延伸到Coding、Agent、多模態和真實任務執行。LongCat-2.5-Preview已經給出了一次階段性答卷,接下來可以關注正式版在速度、穩定性和複雜任務能力上的進一步表現。
Related
相關文章

何愷明團隊新作:看貓片就能學會ARC挑戰
何愷明團隊提出NAT-ARC,一種純視覺的ARC解題方案,不依賴語言模型,而是使用ImageNet上的自然圖像進行MAE預訓練,再遷移到抽象格子推理任務。該方法在ARC-1上達到63.4%的單模型pass@2分數,集成後提升至70.2%,逼近專用LLM系統的表現,並證明了視覺預訓練能有效破解抽象推理的scaling瓶頸。

谷歌Gemini 4突然發佈!RSI加持,GPT和Opus都讓讓
。。。 假期第一天,谷歌攜Gemini 4 Argon空降多榜單第一。 拳打Opus 5.5,腳踢GPT-6 Astra。 更誇張的還在後頭,單項任務成本最低可至1.99美元,直接是Astra費用砍半。 最高百萬Token輸出上限,面向編程、金融和法律等複雜工作流,而且劃重點,網絡安全防禦能力超牛掰。 這波等等黨要贏麻了。 不過吧,咱普通用戶現在只可遠觀,暫時還吃不上。

階躍星辰“第一梯隊”,是“自嗨”嗎?
AIX財經2026.10.01 18:22 · 來自福建全文5252字00:00 / 15:27同行各自跑出了主線,階躍的“全棧”能跑通嗎?文 | AIX財經,作者|雷晶,編輯|魏佳沉寂許久的階躍星辰,正試圖擠進大模型第一梯隊。9月20日,它發佈Step 5 Preview,原生支持文本與視覺輸入,重點面向編程、軟件工程、專業知識工作和長程Agent任務。上線初期,登錄並完成首次調用後可獲得30天的Step Plan免費使用權。幾天後,Step Plan的月度套餐一度售罄。
Cohere 發布 Embed 5:與 Voyage 4 Large、Gemini Embedding 2 及 OpenAI 的比較
Cohere 推出全新嵌入模型系列 Embed 5,專注於企業搜尋、RAG 及代理檢索。該系列分為兩個版本:Embed 5 Pro 專注於最高檢索品質,Embed 5 Fast 則針對即時查詢路徑的延遲與成本最佳化。兩者皆支援文字、圖片及文字與圖片混合輸入,涵蓋 100 種以上語言,且可處理多達 128K token。關鍵設計在於 Pro 與 Fast 共享同一嵌入空間,因此可用其中一個進行索引,另一個進行查詢。目前這兩個版本已在 Cohere API、Model Vault、Microsoft Foundry 及 Amazon SageMaker 上正式上線,私有 VPC 或本地部署則可透過 vLLM 提供服務。根據 Cohere 模型文件,API 模型 ID 分別為 embed-v5.0-pro 和 embed-v5.0-fast,兩者輸出維度皆為 2048 或 1536。

騰訊經銷、字節駐場、Kimi借船:FDE成了大模型的新成本?
新立場Pro2026.10.01 16:16 · 來自四川全文5421字00:00 / 16:08AI公司活成了它們最討厭的樣子。文 | 新立場Pro今年 3 月 6 日上午十點,深圳騰訊大廈樓下開始排隊。人們帶著電腦,等騰訊雲工程師幫自己安裝 OpenClaw,首批八十多人在十點開始排隊,到十一點,數百個預約號已經發完。

谷歌推出了個“做題家”:Gemini 4 Argon屠榜,但幹活差點意思
字母AI2026.10.01 16:16 · 來自北京全文3510字00:00 / 09:31消失10個月的谷歌,為什麼連Pro這塊招牌都扔了?文 | 字母AIGemini 4可算來了,連名字也換了:這次的旗艦不叫Pro,叫Argon。從谷歌公佈的成績看,Gemini 4 Argon在知識工作方面表現搶眼,多項測試超過了OpenAI和Anthropic的旗艦模型。它主打一個知識面廣,從金融、法律到數學、科學,都有不錯的表現。谷歌還確認,9月15日在LMArena上亮相、表現接近GPT-6 Astra的“3.