不同模型廠同一家Agentic Infra,AGI時代的地基終於浮出水面

重點摘要
在WAIC 2026的論壇現場,出現了一幕饒富趣味的場景:MiniMax與階躍星辰不約而同地出現在同一家AI Infra公司的活動中,前者簽署戰略合作協議,後者發表主旨演講。這並非偶然。早在四個月前的中關村論壇上,智譜的張鵬與Kimi的楊植麟就已與這家公司的聯合創辦人兼CEO同台參與圓桌討論,並在現場被點名該公司已為Kimi與智譜提供服務。四家中國頭部基礎模型公司,先後與同一家AI Infra業者達成深度合作——這家企業正是無問芯穹。
在WAIC 2026的論壇現場,出現了一幕饒富趣味的場景:MiniMax與階躍星辰不約而同地出現在同一家AI Infra公司的活動中,前者簽署戰略合作協議,後者發表主旨演講。這並非偶然。早在四個月前的中關村論壇上,智譜的張鵬與Kimi的楊植麟就已與這家公司的聯合創辦人兼CEO同台參與圓桌討論,並在現場被點名該公司已為Kimi與智譜提供服務。四家中國頭部基礎模型公司,先後與同一家AI Infra業者達成深度合作——這家企業正是無問芯穹。這樣的局面,讓人聯想到電動車電池領域的寧德時代:造車的廠商可以各自努力,但電池這一層卻繞不開。無問芯穹的目標,正是成為大模型時代的共通基礎設施。
需求與供給之間的巨大鴻溝,是無問芯穹站穩位置的關鍵。2026年,推理需求正式超越訓練,成為AI算力消耗的主戰場。推理成本在兩年內下降了280倍,但企業的AI總支出不降反升。中國每日Token調用量已突破140萬億,一年內成長四成,需求呈現指數級增長。然而,供給端的物理算力擴產邏輯仍是線性的——多蓋機房、多買顯卡,但缺口在未來三到五年內仍難以填平。這一條裂縫,正是無問芯穹想要填補的空間。更棘手的是,模型部署的品質好壞,外界難以察覺。當一個請求送出後,模型看似正常回應,但輸出精度可能已悄悄滑落三成,而這類問題常規監控系統無法偵測。等到用戶在業務中發現異常時,模型的信譽已經受損。
這道看不見的門檻,決定了哪家供應商能真正留在牌桌上。Kimi、智譜、MiniMax、階躍星辰之所以選擇無問芯穹,本質上是將三項核心需求同時託付:模型效果不打折、成本負擔得起、系統穩定可靠。以效果為例,先前有第三方供應商部署模型後,精度比原廠低了30%,客戶卻渾然不覺,直到業務指標下滑才回頭追查。無問芯穹為此建立了一套准入測試標準,從工具調用一致性到推理模式的精度對齊,逐一核驗,確保每個新模型上架前都經過嚴格把關。結果是,客戶無論透過無問芯穹還是原廠API,體驗幾乎沒有差別。在成本方面,無問芯穹在今年WAIC上發布了一項自研技術——跨集群異構PD分離。
大模型推理中的Prefill與Decode兩個階段負載特性截然不同,硬體需求也各異,分開部署能讓不同類型的晶片各自發揮所長。然而,當兩個階段拆分到不同機房後,面臨廣域網乙太網路傳輸KV Cache的挑戰:頻寬低、延遲高,猶如接力賽中兩位選手各自跑得飛快,卻在交棒時掉鏈子。為了解決這個問題,無問芯穹首先將Decode實例設計的Radix Cache技術創新性地遷移到跨集群架構中,使傳輸數據量直接降低一個數量級。接著,他們首創了PDD架構,將傳統的PD鏈路拆成P、RelayDecode、MainDecode三級。
當遇到傳輸延遲較高的請求時,RelayDecode先頂上,迅速吐出Token給用戶,讓用戶完全感受不到背後實際長達數十秒的延遲,等數據傳輸完畢再無縫切換給MainDecode接手。實測顯示,該架構在首Token延遲(TTFT)降低51.5%的同時,單Token成本可降低37.5%。穩定性方面,大規模集群的故障往往藏得很深。無問芯穹管理數十上百個集群,每日承載全國上T規模的流量分發,一旦伺服器宕機,靠人力監控根本來不及反應。
為此,他們發布了「智算集群運維智能體系統」,能夠7×24小時全天候自動值守,將運維從「人找問題」轉變為「問題找人」以及「問題自己解決」,實現運維人效提升5倍以上,關鍵故障處理效率提升6倍。以上三項突破,僅構成「Token工廠」這一層的地基。無問芯穹的真實企圖,是將算力、Token、生產力串成一個完整的系統,對應其提出的公式:AI生產力 = 智能資源規模 × Token轉化效率 × AI生產力轉化效率。這個系統被稱為「前店後廠一中心」的Agentic Infra戰略布局。「一中心」指的是算力集散中心,也就是Agentic Infra自主式基礎設施平台。
面對國產晶片生態的碎片化,無問芯穹將散落各地的算力資源統一匯聚、彈性調度、按需利用,為模型與應用層提供充足、穩定、可擴展的算力底座。目前該集散中心已部署觸達37,000P算力,覆蓋16種主流晶片。跨集群強化學習的挑戰也在這一層被攻克:無問芯穹將網絡、平台、框架三層優化貫穿,實現跨域強化學習訓練連續一週零中斷穩定運行,讓大規模跨域強化學習不僅「跑得通」,還能「跑得快、跑得穩」。未來,他們將持續深耕並行策略、通信融合、智能算子、極致容錯等技術,把跨域計算資源的支撐規模拓展至十萬卡級以上。「後廠」則是Token工廠,亦即Agentic MaaS大模型服務平台。
這裡是前述效果、成本、穩定性三重優勢真正兌現的地方,核心思路是「在規模之上向效率要產能」。整套服務技術棧從網關、路由到底層推理實例,層層可優化、處處有增量。截至7月,無問芯穹Agentic MaaS平台的日均Token調用量,較去年12月成長了40倍。此外,他們還與上海移動聯合打造了「天問」模型服務門戶,並與觀猹合作推出面向開發者的「TokenDance」,對標OpenRouter。「前店」則是將累積的能力覆蓋各行各業的「AI生產力商店」,即Agentic Infra行業解決方案。
這套方案已涵蓋文娛遊戲、醫療健康、法律終端、能源電力等領域,例如與VAST合作3D遊戲解決方案、協助上海瑞金醫院探索醫療大模型落地場景、為多家律所打造AI合夥人產品,以及與南方電網研究智算中心的能耗預測。值得注意的是,無問芯穹也將智能體的能力應用到AI Infra本身,打造了基礎設施智能體蜂群,包括面向用戶的平台管家智能體系統(可獨立解決80%日常問題)、面向集群的運維智能體系統,以及面向晶片的算子生成智能體系統。在GLM 5.2模型的實測中,後者在NVIDIA旗艦卡上實現端到端7.3%的性能提升,在AMD旗艦卡上更帶來39%的整體躍升。
如果只將無問芯穹視為一家賣Token的公司,就會錯過其完整的商業模式。「Token工廠」只是入口,真正在鋪設的是面向Agent時代的完整Agentic Infra布局。這套故事的說服力,從四家頭部模型廠商的深度合作便可見一斑。放眼海外,無問芯穹對標的對象是Baseten、Together AI、Fireworks AI,這些公司估值都在130億至150億美元之間。但這三家底層皆建立在NVIDIA單一生態之上,而無問芯穹面對的是遠比海外碎片化的國產晶片生態,也因此將多元異構與更完整的架構布局,打造成自己的護城河。
懂算力、懂模型結構、懂訓練推理優化、懂應用場景——這四件事同時做到,正是這條賽道上真正稀缺的能力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。