213:1的Token懸殊背後,智能體正在改寫推理方式

2026年9月23日 18:33
213:1的Token懸殊背後,智能體正在改寫推理方式
站內 AI 整理稿

芯東西(公眾號:aichip001) 作者 | 江宇 編輯 | 漠影 9月21日下午,北京中關村國際創新中心,開源推理框架SGLang核心貢獻者王書文放出一組數據:在Agent流量裡,一次請求的中位數輸入是8.8萬個Token,輸出卻只有413個Token,兩者相差213倍。“智能體時代,算力並不是花在輸出上,而是花在反覆攜帶的歷史上下文上。”他說。這裡,便是AICC2026人工智能計算大會下設的“AI軟件棧”分論壇。現場,SGLang團隊圍繞Agent時代推理負載的變化進行了分享。當天,AICC2026人工智能計算大會在北京中關村國際創新中心舉行,近3000名產業人士來到現場。

大會一口氣設置了AI芯片、Token工廠、開放超節點、大模型、AI軟件棧、具身智能與智算發展、AI Work智能體七場專題論壇,把芯片、系統、軟件、模型與應用等產業鏈不同環節聚到了一起。就在同一天、同一個大會里,芯片廠商、系統廠商與推理框架的開發者,都聚到了同一張桌子前。從長上下文帶來的緩存壓力,到多元芯片適配,再到互連、調度與軟件棧協同,討論的焦點已經很難被拆成某一個環節的問題。他們最終指向的是同一道題——當智能體從一次調用走向持續任務鏈,中國AI計算的下一步,該怎麼走?一、智能體爆發,AI計算每一層都在被重新定義 智能體的爆發,正在把算力推上國家戰略基礎設施的位置。

2026年,智能體從發佈會上的演示,走進了真實的生產、科研和社會服務;一次智能體任務,可能包含規劃、多輪推理、工具調用、記憶、校驗和重試,負載變長、併發增加,系統還必須可恢復、可觀測、可承擔成本。在AICC現場,大會把這種變化拆成了三層產業信號來討論。其一,智能體改變了計算的服務對象。基礎設施過去服務一次模型調用,現在要服務一段持續的任務。其二,真實應用負載正在反向定義計算體系。2026年6月,OpenAI與博通發佈的Jalapeño芯片,直接以模型路線、計算內核、推理服務和產品需求來指導芯片設計,模型與應用的需求,正沿著產業鏈向上遊延伸。其三,全球同時發生技術路線多元化與系統級整合加深。

在Hot Chips 2026上,GPU、定製芯片、晶圓級計算、RISC-V、Chiplet、存算一體同臺出現,頭部企業又在圍繞真實負載,加強從芯片到軟件的全棧協同。放到中國AI計算產業的語境裡,AI正在同時向兩個方向延伸: 一場向上,推理、工具使用、長程任務和科學發現能力不斷突破智能上限;一場向外,成本下降與智能體普及,讓智能從少數機構掌握的能力,走向企業、個人和社會普遍需要的生產力。智能體改變的是整條AI計算產業鏈的組織方式。理解這一點,是讀懂這場大會、以及下文聚焦的infra層的起點。

二、從“回答一個問題”到“持續幹活”:一次Agent任務,推理側發生了什麼 回到開篇王書文的那組數據,這直接揭示了一個變化:Agent正在把推理從一次調用,變成一段連續的任務鏈。過去,一次推理就是“回答一個問題”:請求進來,模型算一遍,Token返回,結束。現在,智能體要“持續幹活”:為了完成一個任務,它一遍遍調用模型,先規劃、再搜索、再調用工具、再讀取結果,上下文隨之越積越長,並且每一次調用模型,都需要輸入完整的歷史上下文。推理系統要面對的,從一次次獨立的計算,變成了一段連續的任務鏈。負載的形態變了,計算壓力也隨之發生變化。

213:1的輸入輸出比例意味著,在智能體場景裡,大量歷史信息會隨著每輪調用反覆進入模型,真正新增的內容反而只佔很小一部分。這些負載高度集中在三種模式上:多輪複用與追加、子智能體分叉,以及工具循環與重試。三種模式疊在一起,數據的結構“更像一棵樹”:用戶只和智能體對話了幾輪,智能體後端卻已經和模型交互了幾十輪,到後來90%以上的Token,都花在了歷史上下文的累積上,真正需要重新計算的只是一小段。據SemiAnalysis的報告,智能體現在已經貢獻了約70%的推理流量。負載變了,推理系統的優化目標也要隨之變化。

這正是SGLang這類開源推理框架多年在做的事:既然大量Token是在重複計算同一個上下文,那就想辦法讓它“複用”,而不是重算。SGLang最早提出的RadixAttention,用一個前綴數來查找KV Cache,讓共享前綴的Request能夠通過前綴數快速查找到已經計算好的KV Cache,並進行復用;顯存放不下時,再用HiCache把緩存下沉到內存甚至SSD,把上下文拉得更長。這種變化的效果是實打實的。王書文現場給出的實測數據顯示,早期緩存命中率只有10%至30%,接入跨實例存儲後,可以提升至80%至90%,首Token延遲也隨之明顯下降。

從回答一個問題到持續幹活,推理側的核心矛盾,從算得快變成了少重複算。理解了這一點,才能看懂接下來兩層:推理框架和算子系統,各自在解決什麼。三、從模型發佈到跑起來,infra層要闖過“九道關” 用戶看到的只是一個“能用”的模型,但一個模型從發佈到真正跑進產業,中間隔著一條很長的流水線。應用與智能體提出需求、模型發佈、推理框架支持、算子補齊、芯片適配、功能跑通(day 0)、精度對齊、單算子/單機性能調優、系統級推理優化,再到生產化投產。在AICC現場,這條鏈路被多位講者反覆梳理,業內把它稱作“九道關”。這條流水線,大體可以分成兩層來看。

上層是推理框架,回答一款新模型今天發佈,推理服務最快什麼時候能跑起來;下層是算子與系統,回答一款模型要在國產多元芯片上都跑起來、結果對、性能也夠好,需要解決什麼。這兩層在大會前後,各有一個看得見的標誌性進展。框架這一側,答案落在“Day-0”上——新模型發佈當天,推理框架就能完成支持。SGLang核心貢獻者在現場列出了近期第一時間完成支持的DeepSeek-V4.1、千問3.8 Flash、Nemotron 3.5等模型。算子這一側,變化發生在大會召開前不到一個月。阿里Qwen3.8-Flash-Next、智譜GLM-5.

3-Flash、騰訊Hy4 preview三款MoE模型接連上新,帶來了全新的注意力結構、複雜的混合注意力部署,以及770B超大參數等不同適配難題。智源牽頭的眾智FlagOS社區,在四天之內連續完成三輪多芯適配,其中兩款實現了發佈當日Day0,適配範圍覆蓋摩爾線程、沐曦、崑崙芯、海光、天數智芯、清微智能等10款AI芯片。這種速度背後,是一套逐漸沉澱下來的公共技術資產,包括算子庫、編譯器,以及對接vLLM和SGLang的插件層。新模型出現後,共性的能力可以沉澱在公共層,芯片之間的差異則儘可能收斂到插件和底層適配環節,從而減少各家重複完成同一套工作的成本。

我們在現場觀察到,這條過去由各家廠商各自為戰的流水線,正在變成一套可以複用的公共基礎設施。四、需求在漲、供給受限,中國AI計算的答案是開源協同 當然,對中國市場來說,這條流水線還有一層更現實的約束。當智能體加速進入生產、科研和社會服務,推理需求持續增長,對算力供給的規模、效率和適配能力也提出了更高要求。這道題怎麼解?我們在大會現場看到的一個共同方向,是開源與多元。圍繞這一方向,產業正在形成多種探索路徑,其中,開源框架、基礎軟件與多元算力適配,是一條值得關注的路線:把不同芯片、系統和軟件組織起來,轉化為穩定、高效、可規模供給的系統能力。具體來看,可以觀察兩類樣本。

SGLang等開源推理框架,就是其中一個縮影。通過緩存、調度和系統級優化,推理框架正在進一步提升計算資源利用效率,讓有限的硬件資源承載更多推理任務。另一類探索發生在多元芯片適配層。以智源牽頭的FlagOS為例,其希望通過更加統一、開放的基礎軟件體系,降低不同模型、框架與AI芯片之間的適配成本,讓新模型能夠更快運行在不同計算平臺之上。FlagOS社區將這一問題概括為,讓複雜的“M×N”適配儘可能向“M+N”模式演進。過去,每種模型框架和每款芯片都可能需要單獨適配;如果算子、編譯、框架等公共層能夠形成更統一的接口和協作方式,框架側與硬件側分別對接公共層,就有機會減少重複適配,提高技術複用效率。

這種開源協同的價值,也開始落到具體的數字上。我們在現場聽到一種形象的說法,是把推理服務看成一座“Token工廠”:投入的是GPU、服務器、網絡和電力等固定成本,產出的是Token這一可變收益。有廠商基於開源推理框架和分佈式緩存系統搭建推理底座,日均Token產量已穩定突破1萬億,生產效率較此前提升3倍,總產能增長超過30倍。可以看到,在算力需求持續增長、硬件供給存在約束的情況下,中國AI計算正在嘗試藉助開源協同,把有限的單卡性能、分散的多元芯片和快速變化的模型,組織成更穩定、更高效、可規模供給的推理能力。

結語:讓智能可獲取、可負擔,是中國AI計算的下一個命題 智能體時代,中國AI計算的真正命題,是如何把多元的芯片、系統和軟件組織起來,持續支撐智能體的規模化運行——既讓前沿智能不斷突破上限,也讓智能普遍進入千行百業。AICC2026給出的答案是開放與協同。大會現場,推理框架與算子層所呈現的進展,看似技術而細微,其實都在回答同一個問題:如何讓一款新模型更快地跑起來、在更多芯片上跑起來、讓更多人以更低的成本用上它。當智能體從少數機構的演示,變成企業、個人和社會普遍需要的生產能力,AI計算的競爭,已經升級為一場開放協同的競爭。誰能把多元的芯片與軟件擰成一股可以規模供給的算力,誰就能定義智能普惠的底座。

這正是這場大會,以及中國AI計算產業,正在書寫的下一步。

Related

相關文章

鈦媒體生成式AI

殺豬盤最貴的一道工序,AI 接手了

硅谷Tech news2026.09.23 19:45 · 來自河南全文2595字00:00 / 06:51讓人心甘情願地把錢交出去。讓 AI 扮演一個虛構角色陪人聊天,已經是一個成型的商業門類。近期,這個門類裡也出現了另一類看起來並非合規的操作,從全球來看甚至有應用開發商用大模型搭起了 20 多款約會 App,用戶刷到的“匹配對象”裡 75% 不是真人。

剛剛

​科大訊飛正式發佈 Spark-ASR-2.0,全面賦能硬件與開放生態

9月23日,科大訊飛官方正式發佈了全新一代語音識別大模型 Spark-ASR-2.0,標誌著其在語音交互與智能硬件落地方面邁出了關鍵一步。在具體的上線與落地節奏方面,該模型將於次日(9月24日)起在訊飛輸入法中逐步上線,同時通過訊飛開放平臺面向開發者與企業客戶全面提供 API 服務。

剛剛
量子位生成式AI

達卯科技完成新一輪融資,算電協同核心軟件層“稀缺標的”

達卯科技近期完成約2億元新一輪融資,該公司專注於算電協同AI能源運營作業系統,是賽道內少數已實現商業落地的軟體層企業。其核心產品算電協同2.0平台已具備GW級智算中心綠電直連的全週期營運能力,股東陣容包含寧德時代、商湯科技等龍頭。隨著算電協同獲國家政策支持並寫入政府工作報告,公司透過「技術賦能+營運落地」模式持續拓展市場。

剛剛

國內開發者如何穩定使用 Claude Code、Codex 和 Gemini CLI:從配置接入到團隊協作

對於個人開發者、獨立開發者和企業研發團隊來說,AI 編程工具已經成為提高開發效率的重要組成部分。不過,在實際使用過程中,很多國內開發者遇到的問題並不只是模型能力本身,還包括網絡連接、支付方式、配置流程、額度管理和售後支持等。一、使用 AI 編程工具時,開發者常見的問題網絡連接不穩定在使用 AI 編程 Agent 處理複雜任務時,一次任務可能需要持續運行幾分鐘,甚至更長時間。

剛剛

Anthropic 擬租賃最高 1 吉瓦算力,減少對雲廠商依賴

這被視為這家 AI 公司降低對雲廠商依賴的重大舉措之一。若交易達成,Anthropic 將直接掌握相當體量的算力供給,而不再單純依賴第三方雲平臺按量分配。目前談判仍處早期,最終租賃規模、期限與具體開發商尚未敲定,但“最高 1 吉瓦”的目標已顯示出 Anthropic 對自有算力底盤的強烈訴求。

剛剛