梁文鋒押注的方向,中國00後團隊先交卷了,性能直逼Opus 4.8

2026年7月24日 10:56
梁文鋒押注的方向,中國00後團隊先交卷了,性能直逼Opus 4.8

重點摘要

# 梁文鋒押注的方向,中國00後團隊先交卷了,性能直逼Opus 4.8 上週,AI圈接連發生兩件大事,揭開了一個關鍵賽道的序幕。7月15日,前OpenAI CTO Mira Murati在舊金山正式發布了Thinking Machines Lab的首個模型Inkling,這款975B參數的模型耗資20億美元,由100人精英團隊打造。幾乎同一時間,太平洋這一頭,一家成立不到一年的中國實驗室——Mind Lab,低調推出了自己的第一款作品Macaron-V1。748B參數,性能在多項評測中直逼甚至超越Opus 4.

站內 AI 整理稿

# 梁文鋒押注的方向,中國00後團隊先交卷了,性能直逼Opus 4.8

上週,AI圈接連發生兩件大事,揭開了一個關鍵賽道的序幕。7月15日,前OpenAI CTO Mira Murati在舊金山正式發布了Thinking Machines Lab的首個模型Inkling,這款975B參數的模型耗資20億美元,由100人精英團隊打造。幾乎同一時間,太平洋這一頭,一家成立不到一年的中國實驗室——Mind Lab,低調推出了自己的第一款作品Macaron-V1。748B參數,性能在多項評測中直逼甚至超越Opus 4.8、GPT-5.5和Gemini 3.1 Pro。這條路,正是DeepSeek創始人梁文鋒反覆強調的「下一代模型必須邁過的臺階」——持續學習。 ## 持續學習:圖靈獎得主與中國創業者的共識

強化學習之父、2024年圖靈獎得主Richard Sutton,年近七十宣布創辦Oak Lab時直言:「當前的深度學習方法是脆弱且低效的,需要的不是修修補補,而是從根基上重新來過。」梁文鋒的判斷如出一轍。他把AI發展比作一級級臺階:語言模型、CoT、Agent……而Agent之後,下一個必須邁過的臺階就是持續學習。他認為,下一代模型的核心能力必須是持續學習,如果先把持續學習做出來,通用智能可能就很容易了。當一條技術路線同時被圖靈獎得主、硅谷最受關注的AI創業公司和中國最具創新力的大模型創始人押注,風向已經明朗。 ## Mind Lab:30人團隊,5000萬美元的「輕騎兵」

Mind Lab成立於2025年10月,是Mindverse(心洲科技)旗下的前沿研究實驗室。整個團隊三十多人,成員來自xAI、DeepMind、DeepSeek、字節Seed、MIT和清華。年初完成5000萬美元A輪融資,美團領投,螞蟻、紅杉中國、真格等跟投。與硅谷同行動輒數十億美元的燒錢規模相比,這支由95後、00後唱主角的團隊,顯得格外輕巧。 ## Macaron-V1:四個LoRA各管一攤,拆出高效能

Macaron-V1分兩個版本:旗艦版Venti,748B參數,由744B的GLM-5.2基座加四個1B的LoRA組成,原生支援2M超長上下文;標準版Tall,35B參數,基於Qwen-3.7後訓練,Mac上就能跑。關鍵在於那四個LoRA。傳統上,LoRA被視為全參微調的「窮人版替身」——省錢,但打折。Mind Lab重新定義了它:基座模型承載「共性」,LoRA承載「個性」。 聊天需要自然共情,編程需要嚴格精確,Agent需要多步規劃,生成式UI需要設計交互——擠在一套參數裡訓練會互相打架。Macaron-V1的做法是拆成四個獨立LoRA,分別管聊天、Agent、編程、GenUI,各自訓練、各自評測、各自回滾。運行時由路由器動態切換,對用戶完全透明。這套架構正式名稱為Mixture-of-LoRA(MoL),讓一群專才在共享基座上協同作戰。 ## 硬核性能:登頂SWE-bench,碾壓同儕

評測結果令人矚目。在業界公認最硬的代碼能力評測SWE-bench Verified上,Macaron-V1-Venti以85.6分登頂第一,甩開第二名3分,將DeepSeek-V4-Pro(80.6)、MiniMax-M3(80.5)、Kimi-K2.6(80.2)全部壓在身後。在專測長程複雜軟件工程任務的Deep-SWE上,Venti拿下58.4分,而其基座模型GLM-5.2僅為46.2分——同一個底座,經過LoRA強化學習後訓練,直接高出12個點。此外,在生活場景、生成式UI等方向,Macaron-V1也表現突出。更重要的是開放權重與可私有化部署,數據無需離開客戶服務器。 ## 「全球唯二」的萬億參數LoRA強化學習能力

你可能會說:LoRA微調有什麼了不起?滿大街都是。但關鍵在規模。30B模型做LoRA強化學習,很多團隊能做到;參數量上到萬億級別,難度指數級上升。核心難點是訓推不一致:強化學習需要一邊訓練一邊推理收集反饋,萬億參數的MoE模型切片分佈到幾十張GPU上時,訓練精度和推理精度稍有偏差,梯度就會漂移,訓練曲線直接不收斂。全球能在萬億參數規模上跑通LoRA強化學習的團隊,只有兩家——一家是Mira Murati的Thinking Machines Lab,另一家就是Mind Lab。2025年12月,Mind Lab在總參1.04萬億的超大稀疏MoE模型Kimi K2上成功跑通,算力僅為全參微調的十分之一,訓練曲線穩定收斂。本月的LongStraw,又在固定GPU算力下將強化學習後訓練推進到2M上下文。Macaron-V1,正是這些積累的集中亮相。 ## 底座策略:硅谷花20億做底座,它花十分之一站在巨人肩上

這是一場極具反差感的對比。TML因為種種原因選擇從零訓基座,Inkling參數高達975B,訓練數據達45萬億token,但Murati本人也承認「這不是目前最強的模型」。評測顯示,Inkling明顯弱於GLM、Kimi等中國開源模型。從零做底座消耗了大量精力和算力。Mind Lab反其道而行——它不自己訓底座,而是直接站在中國開源模型生態的肩膀上。Kimi K2驗證萬億參數LoRA RL、V1-Preview基於GLM-5.1、正式版Venti用GLM-5.2、Tall用Qwen-3.7,每次基座升級,後訓練的起跑線就高一層。中國開源模型已接近全球SOTA水平,Mind Lab只需在接近天花板的底座上,通過LoRA強化學習將關鍵能力推向真正的SOTA。你不必自己種麥子,就能烤出最好的麵包。TML用20億美元、100人團隊、英偉達千兆瓦級算力合作,換來的能力仍落後於GLM-5.2;Mind Lab三十多人、不到5000萬美元,在Chat、Agent、Coding等多個維度做出了更強的模型。在LoRA強化學習這件事上,Mind Lab可能是全球投入產出比最高的團隊。 ## 從「凍結模型」到「經驗智能」,持續學習破局

Mind Lab的終極目標是打破大模型的根本矛盾:訓完了就凍住了。今天,一個用戶糾正同一個錯誤十次,下次模型還得重讀聊天記錄;一個Coding Agent在同一個代碼庫反覆失敗,失敗不會變成新能力。模型每天處理海量任務,但經驗全部流失。Mind Lab要造一臺「經驗智能機器」——模型離開實驗室後,仍在真實世界裡持續學習。經驗變成新能力,新能力讓它解決更難的問題,更難的問題又帶來更豐富的經驗。智能不再是訓練的結果,而成為持續生長的過程。LoRA在這裡不再是「省錢工具」,而是可寫入、可回滾、可獨立演化的持久狀態。基座承載通用知識,LoRA承載用戶偏好、代碼風格、業務邏輯。實驗證明,輕量適配模塊壓縮到基模參數的0.5%以下仍然穩定可靠——基座越強,小規模更新反而越有效。 ## 群體智能:第三條Scaling曲線

持續學習只是故事的一半。Macaron-V1體現的第二個核心理念更具顛覆性——群體智能。每個模型沿著自身經歷持續學習,不同實例走向不同方向。從相同的Qwen3-30B基座出發,訓練目標和算法完全一致,只改變數據順序與masking,單個adapter在AIME24上準確率為36.44%,而198個不同adapter做多數投票,準確率提升至48.67%。不同「經歷」帶來了單個模型給不出的互補性。Andrew在WAIC將這稱為第三條Scaling曲線:第一條是GPT-3式的Scale Parameters,第二條是DeepSeek R1式的Scale Thinking Tokens,第三條是Scale Number of Models——更多模型之間的協作帶來更高智能上限。Mind Lab自研的MinT平臺已建立百萬級可尋址LoRA目錄,100萬個LoRA共享同一個萬億參數基座。這不是100萬個小模型,而是100萬個一萬億參數的大模型。人與人共享99%以上的基因組,但幾乎相同的生物基礎沒有造就相同的心智——正是智能的多樣性與協作,帶來了人類文明最偉大的成就。 ## 商業化驗證:2周1000萬美金ARR

技術路線再漂亮,市場不買單就只是PPT。Mind Lab於7月初開放API商業化,2周內達到1000萬美金ARR,很可能是所有模型公司從第一個模型發布開始,最快實現千萬美金ARR的記錄。這說明它解決的是真問題、痛問題。Mind Lab賣的不只是Token,而是模型在自身場景中持續學習和迭代的能力。手機廠商將產品知識訓進專屬LoRA,耳機公司將交互偏好寫入模型狀態——核心數據不必交給基模公司重訓,客戶自己掌握控制權。韶音科技、AI硬件初創Odyss、某頭部手機廠商已進入合作名單。API調用結構也均衡:20%聊天,30%Agent工作流,30%代碼生成,剩餘來自GenUI。旗艦版6美元/百萬token,標準版4美元,極速版2美元。Mind Lab的願景是:會用Token,就能訓Token。訓練模型這件事,最終要像調用模型一樣簡單。 ## 門已推開

Richard Sutton在多倫多喊出「經驗時代」。梁文鋒認為必須有持續學習能力才能叫下一代模型。Mira Murati在舊金山搭建萬億參數LoRA強化學習基礎設施。Fireworks AI估值175億美元。所有人都押同一個方向:模型應該在部署後繼續學習。LoRA是讓這件事在萬億參數尺度上可行的關鍵技術。Mind Lab是這條賽道上最年輕的選手,但起跑姿態可能最高效——不做底座,站在中國開源生態上,三十多人和不到5000萬美元融資,做到了與硅谷百億級團隊同一水位的技術能力。大模型競爭的終局,不在「誰訓出最大的底座」,而在「誰能讓模型持續變聰明」。預訓練是一次性的基建,持續學習才是真正的護城河。Murati用20億美元和100人的團隊在舊金山推這扇門,而先把門推開一條縫的,是太平洋這頭,一家站在中國開源生態肩膀上的年輕實驗室。

Related

相關文章

賽馬結束,賭局開始

好的,這是一篇根據您提供的資料,重寫後的新聞稿: --- ### 賽馬結束,賭局開始:科技巨頭收攏AI辦公戰線,Work Agent 成決勝焦點 經歷了上半年的野蠻生長與內部賽馬,中國科技巨頭在AI智能體(Agent)領域的戰略正悄然發生根本性轉變。從騰訊、阿里到字節跳動,各大廠商不約而同地從多點開花的「內部賽馬」模式,轉向「集中火力」的統一戰線。而這場AI賭局的決勝盤,似乎已清晰地指向了同一個目標:企業級AI生產力工具,亦即Work Agent(辦公智能體)。 最新的風向標來自阿里巴巴。

剛剛

Kimi K3,已經撕裂了整個硅谷

# Kimi K3,一场撕裂硅谷的中国风暴 7月22日,四个事件在同一天发生,将中美AI产业的暗流彻底推向了台前。 白宫科技政策办公室主任Michael Kratsios在X上公开指控月之暗面(Moonshot AI)的Kimi K3涉嫌“大规模蒸馏”美国模型;OpenAI总裁Greg Brockman在接受Bloomberg采访时罕见承认K3“是一个很不错的模型”;近200家硅谷创业公司联名致信特朗普政府,警告若封禁中国开源模型,“将。

剛剛
IT之家模型更新

估值 100 億美元,消息稱海外支付巨頭 Stripe 擬收購全球最大 AI 聚合平臺 OpenRouter

首頁 > 智能時代>人工智能 估值 100 億美元,消息稱海外支付巨頭 Stripe 擬收購全球最大 AI 聚合平臺 OpenRouter 2026/7/24 10:49:39 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 7 月 24 日消息,據《華爾街日報》今日援引知情人士消息,海外支付巨頭 Stripe 正與全球最大 AI 聚合平臺 OpenRouter 洽談收購事宜。

剛剛

帶著AI去前線!36氪逛透WAIC,帶你看懂2026全行業AI最真實走向!

# 帶著AI去前線!36氪逛透WAIC,帶你看懂2026全行業AI最真實走向 2026年7月17日至20日,世界人工智能大會暨人工智能全球治理高級別會議在上海圓滿落幕。黃浦江畔,人潮與熱浪一同湧動,本屆大會以“智能夥伴,共創未來”為主題,在世博、張江、西岸三地四館同步展開。作為年度人工智能產業最重要的觀察窗口,WAIC 2026傳遞出的關鍵信號清晰而明確:技術展示正在退居幕後,真實場景、系統交付與商業價值被正式推到了臺前。 這也是36氪“氪話未來”連續第三年深入WAIC現場。

剛剛