“智能vs成本”這道送命題,被MiniMax破解了?

2026年8月28日 08:50
站內 AI 整理稿

作者 | 王涵 編輯 | 漠影 8月28日報道,8月26日,中國AI大模型龍頭企業MiniMax(稀宇科技)發佈了其自港股上市以來首份半年報。財報顯示,MiniMax的收入同比增長283.1%,其半年收入已達到2025年全年收入的1.5倍;毛利同比增長 464.8%。財報會上,MiniMax創始人、董事會主席、CEO、CTO閆俊傑透露,8月,MiniMax的ARR破了8億美元,B端收入佔比衝到了80%,7月的Token消耗量是1月的20倍。除去數據,吸引我注意的,還有閆俊傑在昨晚的業績會上說的一句話。他說:“只有最小化單位智能成本,才有可能最大化智能水平。

” 要知道,過去兩年,大模型基本就兩條路:要麼按照Scaling law堆參數衝智能,代價是成本高;要麼是降低效率做普惠,但智能水平總差點意思。行業似乎默認這是魚和熊掌,不可兼得。MiniMax為什麼會選擇一條與行業“反直覺”的路?這條路究竟能不能走通呢?一、智能與成本,為何難以兩全?Scaling Law驅動了AI過去幾年的敘事:參數越大,智能越高。遵循著Scaling Law,目前模型的參數已經堆到了2-3T的級別,模型的智能也水漲船高,人人驚呼AGI即將到來。在繁榮背後,這個規則也埋下了一顆雷:當模型進入萬億參數量級,推理成本開始變得不容忽視。

英偉達CEO黃仁勳在2026年GTC大會上做出判斷:“訓練支出作為主要成本驅動因素的時代已經結束了。推理才是現在的工作負載,而且它正在快速擴張。” 推理成本的膨脹,加上Agent工作負載的崛起,AI正在從一問一答走向多步驟自主執行。單次用戶請求背後可能是十幾次甚至幾十次模型調用,這讓整個行業的算力賬單以指數級速度攀升。結果,行業逐漸分成了兩派: 一邊是速度快、成本低,但智能表現中規中矩的小模型。谷歌就是這條路的典型代表。2026年7月到8月,谷歌一口氣推出了Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.

5 Flash Cyber三款輕量化模型。3.5 Flash-Lite是3.5系列中速度最快、成本最低的模型,專為高吞吐量工作負載和大型AI代理系統中的較小任務而設計。Gemini 3.6 Flash的輸出Token使用量比前代減少了17%。但代價也很明顯。谷歌至今仍未推出旗艦模型Gemini 3.5 Pro,這款原定於5月I/O大會上發佈的產品,至今都沒有見光。另一邊是智商在線,但部署貴、成本開始變高的大模型。國產大模型廠商正在這條路上狂奔。2026年7月,月之暗面發佈Kimi K3,參數規模達到約2.8萬億,是目前全球參數量最大的開源模型。阿里緊接著推出Qwen3.8 Max,參數量約2.

4萬億;百度文心5.0同樣達到2.4萬億參數;DeepSeek V4-Pro參數量為1.6萬億。參數規模帶來的智能提升肉眼可見。Kimi K3在多項Agent榜單上超越Claude Fable 5和GPT-5.6 Sol。Qwen3.8 Max被描述為“參數規模最大、性能最強的開源模型之一”。但成本也水漲船高。Kimi K3的API定價,非緩存輸入從每百萬Token 6.5元漲到20元,輸出從27元漲到100元,分別上漲208%和270%。官方建議採用64張及以上加速卡組成超節點部署。發佈僅兩天後,月之暗面就宣佈暫停C端新用戶訂閱,將全部算力投入保障已有用戶。

智能越前沿,模型參數越大,調用越貴,部署門檻越高,算力越緊缺……這似乎成了一個難以解開的死結。二、MiniMax,不做取捨 對於成本和智能二選一的難題,MiniMax的選擇是:我全都要。閆俊傑在財報會上基本把MiniMax的整套邏輯講清楚了: “算力對每家公司都是有限的。我們希望通過‘Minimize the Inference Cost, Maximize the Intelligence’實現‘Intelligence with Everyone’。這是我們一直堅持的技術路線,也是創業初心。

” “Minimize the Inference Cost, Maximize the Intelligence”,意思是“最小化推理成本,最大化智能”。MiniMax將降低成本和提高智能放在了同一個敘事框架裡。為什麼這兩件事可以放在一起說?因為MiniMax對“推理”的理解不太一樣: 第一,推理是製造下一代智能的生產資料。過去認為推理是“用模型”,訓練是“造模型”。但現在,合成數據、強化學習的Rollout、模型評測和驗證、Agent與環境的交互等等這些核心環節,本質上跑的都是推理負載。後訓練環節在整體訓練算力中的佔比越來越高。

推理已經不是訓練結束之後才出現的工作量,而是貫穿訓練全過程的消耗。所以,推理效率決定的不只是API的定價空間,更決定了下一代模型能訓練到什麼程度。第二,推理成本優化是智能迭代的必要條件。算力有物理上限,模型規模卻在持續擴大。如果推理成本降不下來,越往後走成本越會反過來掐住智能提升的脖子。在有限的算力預算裡,能不能把每一塊錢都轉化成有效的智能產出,決定了模型迭代能走多遠。第三,用最低的單位智能成本,去追求最高的智能水平——這兩件事是同一個目標的兩面。行業過去習慣把“智能優先”和“成本優先”當成兩條不同的路線。但推理成本降不下來,再高的智能也落不了地。

簡單理解,MiniMax的思路是把成本優化和智能升級當成同一件事來做。從模型設計的第一天就把推理效率當成核心指標,貫穿整個研發週期。用閆俊傑的話說:“MiniMax追求的不是在智能與成本之間做取捨。追求更高等級的智能是目的,通過持續優化推理成本和效率來實現更高性價比是手段。” 三、計算成本降到1/20,MiniMax把“降本提智”做成了技術閉環 MiniMax一直以來就是遵循著這樣的初心,建立起了一套技術底座。最核心的是其自研的MSA(稀疏注意力)架構。

簡單說,它把百萬字長文本的單位Token計算成本壓到了傳統全注意力機制的約1/20,也就是說M3在1M上下文下每Token計算量只有上代的1/20。這個突破的關鍵在於:總參數量決定模型的知識容量上限,但激活參數量決定單Token推理成本。這兩者可以解耦:參數規模擴張,不一定帶來推理成本同比例上漲。所以M3能在價格不變的前提下把智能水平提上去,M3 Pro能做到約3T參數量級的同時推進強化學習和長程任務訓練。基礎設施層面,MiniMax的ETTR(有效訓練時間比例)能做到97%,是國內最早建立規模化、長期穩定算力體系的獨立大模型公司之一。

通過自主集群、雲廠商和TokenFactory合作的組合方式搭建了算力供給網絡,現有及規劃算力已經能支撐3T級文本模型和視頻模型的持續迭代。結語:算力不佔優,國產模型靠什麼追?每每談到中美大模型的差距,硬件總是繞不開的話題。過去大家默認,誰有更先進的芯片製程、更高的算力,誰就能做出更好的模型。按照這個邏輯,中國AI似乎將永遠與美國AI保持著幾個月到半年的差距。難道就只能如此了嗎?MiniMax給出了一條新路:Minimize the Inference Cost, Maximize the Intelligence。降低單位智能的成本,同樣也是在推高智能上限。

因為今天的後訓練、合成數據、強化學習,本質上跑的都是推理負載。推理效率越高,同樣算力下能做的實驗就越多,智能天花板就越高。誰能用更低的成本產出更高的智能,誰就能在有限的算力裡跑出更遠的邊界,進而讓更高的智能進入更廣泛的生活中。這或許是國產大模型參與全球競爭時,最有希望走通的一條路。而MiniMax,已經開始驗證了。

Related

相關文章

鈦媒體生成式AI

ChatGPT報警後:誰有權審判你的對話框?

腦極體2026.08.28 16:07 · 來自天津全文3780字00:00 / 11:54發現罪犯的AI,該不該報警?文 | 腦極體你敢相信,向AI吐露的私密想法,有一天會被直接遞交給執法部門嗎?在美國就發生了這樣一樁顛覆認知的事件。一名前高盛分析師在對話中向ChatGPT完整描述謀害前女友的犯罪計劃,OpenAI安全系統識別高危內容後,主動向FBI提交線索,當事人最終認罪獲刑。從結果來看,一場明確的預謀惡性案件被提前阻斷,但在行業規則、法律邊界、隱私權益層面,ChatGPT主動報警留下的爭議遠大於成果。

剛剛
IT之家生成式AI

Pro 和 Flash 系列“冰火兩重天”,曝谷歌內部開始測試 Gemini 3.8 Flash 模型

作者:清源 責編:清源 評論: 8 月 28 日消息,谷歌本月才剛發佈新模型,下一款就已經進入員工測試階段,部分谷歌員工開始試用 Gemini 3.8 Flash 預覽版。據《商業內幕》今天(28 日)報道,為了追趕 OpenAI 和 Anthropic,谷歌正在以數週為間隔快速更新模型,AI 競賽的節奏也由此可見一斑。

剛剛
鈦媒體生成式AI

小龍們繞過辦公agent

字母榜2026.08.28 12:33 · 來自北京全文4617字00:00 / 12:40DeepSeek除外,做了“半個”agent。文 | 字母榜辦公Agent成了巨頭們的新角鬥場。但在這場熱鬧裡,智譜、月之暗面、MiniMax等小龍們卻相當冷靜,沒有搞出多大動靜。其實小龍們也做了——Kimi在6月發佈了Kimi Work,智譜在3月發佈了AutoClaw,DeepSeek則在8月開源了 DeepSeek Harness。但很顯然,這並不是什麼“辦公Agent”,只是個人桌面而已。

剛剛