2億Agent即將上線,AI計算底座如何接住這場洪流?一場大會給你講透了!
作者 | 王涵 編輯 | 漠影 就在上週,Salesforce正式上線了一批“job-ready”(即用型)長週期智能體。銷售Agent Hunter可以跨天、跨周持續跟進一個銷售機會——自己做研究、寫郵件、調整策略、更新CRM,直到目標完成或需要人類決策; 客服Agent Casey能在語音、短信、WhatsApp、網頁等多渠道自主處理問題;還有專門負責線索生成、IT/HR服務、供應鏈的Agent等等。進入2026年,Agent成為大熱賽道,國內外的辦公、生活Agent產品如雨後春筍般湧出。Agent在生活中越來越普及,用戶看到的,是“一句話就能把複雜工作交給Agent”的便利。
而產業看到的,是賬單。國際數據公司IDC近期發佈《DAA研究報告》(Daily Active Agents,日活智能體數)。報告顯示,2025年,全球活躍Agent數量是2860萬個,預計2026年達到7940萬個,2030年將增長到22.16億個。Agent全民化的趨勢不可擋,但你有沒有想過,如此大的吞吐量,Agent背後到底靠什麼支撐?水面之上,是“一句話辦事”的便利。水面之下,則是芯片、存算、互連、系統、框架、Infra共同支撐的計算體系。Agent每一次規劃、每一輪推理、每一次工具調用,最終都要落到這套體系上。
最形象的例子就是不久前全球最大開源模型Kimi K3的發佈,該模型在發佈48小時內因算力逼近極限,月之暗面暫停了新用戶訂閱。Agent和模型能力飛速進化,其背後的計算體系有四個痛點越來越棘手: 1、Token消耗巨大,算力成本與穩定性風險 2、芯片架構追不上Agent負載的變化 3、芯片多元了,軟件怎麼協同?系統能力怎麼擴展?4、Agent進入生產系統,穩定供給和可靠運行沒有標準答案 這四個痛點如何解決?行業亟須一個機會,讓模型、芯片、存算、互連、系統、框架、Infra等Agent產業鏈上的每一環坐在一起好好聊聊。這不,機會來了。
2026年9月21日,AICC2026人工智能計算大會將在北京中關村國際創新中心舉行,本次大會設置1個主會場、7個分會場,近60場專題報告。屆時,來自芯片/存算/互連/系統/框架/Infra/模型等領域的專家和學者,將共同探討“當Agent從一次調用走向持續任務鏈,下一代AI究竟需要怎樣的計算體系”。一、Agent越在線,算力越像“無底洞” 據Gartner 2026年3月報告,一個Agent工作流每任務消耗的Token量是標準聊天機器人的5到30倍,原因是單次用戶請求通常會觸發10到20次順序模型調用。
高盛預測,到2030年全球Token消耗量將較2026年增長24倍,達到每月約120000萬億Token;持續在線的智能體每天Token消耗可能超過10萬。這還只是Token層面的消耗。更底層的問題是:支撐Agent運行的大模型本身,正在變得越來越大,越來越難跑。以全球最大開源模型Kimi K3為例,該模型總參數量2.8T、激活參數量104B。K3權重文件約1.56TB,而普通的AI服務器,GPU顯存連權重都裝不下,更別提百萬Token上下文,因此官方推薦擴展到64卡甚至更大規模才能裝得下。即使裝得下,對算力系統顯存帶寬與節點間通信要求也極高。
據SemiAnalysis 的分析,K3每執行一次前向計算,僅HBM帶寬需求就高達約1.5TB;896個專家需要分佈到多卡上,每次前向傳播觸發超過120次All-to-All通信。這意味著,如果互連帶寬和延遲跟不上,大量算力就會被浪費在等待多卡之間的數據搬運上。此外,Kimi K3採用KDA(Kimi Delta Attention)線性注意力與全注意力相結合的混合架構,需要專門的線性注意力融合算子、分塊並行策略以及狀態感知的緩存管理機制。未經優化的超節點系統,初始性能可能僅在10 tokens/s左右。萬億參數模型正在讓傳統AI算力系統遭遇瓶頸。
問題不只是芯片算力夠不夠,更在於模型能不能放下、數據能不能高效搬運、多芯片能不能協同起來。當Agent從偶發請求走向持續在線,算力供給和成本控制怎麼做?這正是AICC2026主論壇上多位嘉賓將要回應的問題。在系統側,浪潮信息首席AI戰略官劉軍將回應算力如何從“堆得更多”走向“用得更好”,通過開放多元的系統架構,以及計算、互連、存儲、軟件的協同創新,讓每一份算力算得其效、算盡其用。在模型側,AI Infra論壇上,由SGLang核心維護者主導,將討論大模型推理的基礎設施重構問題。
SGLang核心貢獻者張曉雨也將在主會場分析Agentic Inference如何通過Kernel、緩存和調度降低時延與成本。此外,在OCTC主辦開放超節點論壇上,百度智能雲、浪潮信息、曦智科技等將共同討論國產AI硬核底座標準。Token工廠論壇上,GPUStack、硅基流動、清程極智、PPIO、積算科技等團隊將拆解推理供給的商業閉環。這些議題共同指向同一個答案——Agent越在線,算力越不能“掉線”。面對持續增長的Token需求,除了多堆芯片,行業還需要更高效的模型框架、更開放的芯片互連,以及更深入的算子優化等系統創新,把算力轉化為更快、更穩定、更低成本的Token。
二、Agent負載發生變化,傳統芯片遇上兩堵牆 Agent負載變長、併發增加、時延層層累積,傳統芯片架構面臨“存儲牆”“功耗牆”與製程瓶頸。傳統馮·諾依曼架構下,存儲與計算分離,數據在兩者之間來回搬運,功耗和時間大量消耗在搬運路上。而Agent負載恰恰對這一點格外敏感。清華大學副校長吳華強將在AICC2026主論壇上討論一個關鍵命題:存算一體能否重構計算架構,讓計算在存儲之處發生?Agent所承載的工作越來越複雜,芯片的能力開始觸及邊界,行業也開始探索更多新架構來擴展芯片能力。例如,北極雄芯創始人&首席科學家馬愷聲就將在大會上拆解Chiplet與3D集成如何拓展芯片能力邊界。
北京開源芯片研究院和智源聯合主辦的AI芯片論壇,將阿里達摩院、摩爾線程、中科院計算所等機構聚在一起,共同思考:當摩爾定律逼近物理極限,除了把晶體管做小,從材料、架構、封裝等多個維度,芯片還有哪些新的可能?三、硬件路線越來越多,系統卻越來越難統一 芯片架構正在從單一走向多元——存算一體、Chiplet、3D集成,每條路線都在試圖接住Agent帶來的複雜負載。但一個問題隨之出現:不同芯片有各自的軟件棧和生態,應用要在多種硬件上運行,遷移和適配成本居高不下。芯片路線越來越多,怎樣才能進入同一個系統,形成整體能力?硬件路線越來越多,軟件如何協同,不同芯片又怎樣形成可擴展的系統能力?
這個問題不僅存在於技術層面,它更是一個決定Agent能否規模化落地的產業問題。主會上,北京智源人工智能研究院副院長兼總工程師林詠華將討論硬件越來越多元,軟件如何讓不同芯片真正協同起來。她主導的FlagOS項目,正是一個面向異構AI芯片的開源統一系統軟件棧,目標是“一次開發,多芯運行”,目前已支持18家廠商32款芯片。在這條路徑上,軟件棧扮演的是“翻譯層”的角色——讓上層應用不必關心底下跑的是什麼芯片,讓不同架構的芯片都能進入同一個系統。四、Agent要“持續辦事”,可靠性、評價尺度、企業落地誰來管?在進入消費者生活的同時,Agent也“打”入了企業內部。
在企業中,Agent更要持續在線、穩定執行,企業級落地對其算力能力、使用成本與穩定供給提出了新要求。據網易有道LobsterAI發佈的《中國辦公Agent用戶行為不完全報告》,辦公Agent單次任務規模在5個月內增長3.1倍,8月環比增幅高達53%,用戶正在將更加複雜、長週期的深度工作託付給Agent。Agent在企業辦公中的角色越來越重要,但對其算力評價的尺度仍停留在算力規模和單點性能,尚未走向系統能力、計算效率與應用價值。Agent時代,哪些行業正在率先把Agent能力轉化為業務價值?Agent的能力又該如何衡量?這正是AICC2026兩個重磅發佈儀式的意義所在。
在大會上,IDC與浪潮信息將聯合發佈《2026中國人工智能計算力發展評估報告》,這是業內首份Agent基礎設施算力研究報告,將系統呈現面向Agent時代的AI基礎設施變革與重構,並揭曉2026年度中國AI算力城市最新排名。另外,一套覆蓋“芯片—框架—模型—應用”的AI測評體系也將同期重磅亮相,填補國內AI第三方評測空白。AI Work論壇上,Datawhale主辦,Dify、記憶張量、平凱星辰、商湯等團隊將討論智能體從技術創新到企業級落地。Agent要真正進入日常和生產,不能只靠“能跑”,還要“可靠地跑、算得清賬、評得出價值”。
結語:看懂中國AI計算的下一步,聽AICC2026這一場大會就夠了 智能體正在從技術創新走向產業實踐,計算體系也隨之從後臺支撐變為決定AI能否規模化、可持續、可負擔的關鍵變量。產業需要的,或許不僅是某一層的單點突破,而是芯片、系統、軟件、應用之間更緊密的協同演進,以及開放、多元、可驗證的產業生態。如何突破?如何協同?新AI時代需要的是怎樣的計算系統?這些問題的答案,都可以在AICC2026人工智能計算大會上找到。大會完整議程:
Related
相關文章

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同
作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

MiniMax Code CLI 正式開源,在評測中取得 76.7% 的任務通過率
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 Domado 的線索投遞!9 月 18 日消息,MiniMax 今晚宣佈,MiniMax Code CLI 的 v0.4.12 版本面向全球開發者正式開放,並且以 MIT 協議正式開放源代碼。

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關
作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。
PrismML Releases Ternary Bonsai 2 27B: A 5.9 GB Apache 2.0 Model Retaining 98.2% of Qwen3.8 27B Performance
PrismML has released Ternary Bonsai 2 27B, a ternary-weight version of Qwen3.8 27B. The language model occupies 5.93 GB, against 53.80 GB in FP16. PrismML reports that it keeps 98.2% of the parent model’s average across 20 benchmarks.

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型
鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率
此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。