從「算得快」到「幹得了活」:AI推理時代,CPU如何重塑算力版圖

2026年9月28日 05:51
站內 AI 整理稿

記者:郭思編輯:包永剛“善弈者謀勢,不善弈者謀子。”這句古老的智慧,正精準地映射出當下AI產業的演進軌跡。當行業狂熱於大模型訓練階段的算力軍備競賽時,一場更為深刻的重心遷移正在悄然發生,AI已經從回答問題走向解決問題,從單純的模型訓練走向複雜的智能體推理。這種轉變對底層算力架構的衝擊,遠比表面看起來要深遠得多。如果說訓練階段是GPU悶頭計算的大兵團作戰,那麼推理時代則是一場需要精密調度的現代化戰爭。在這場變革中,英特爾在9月22的Connection大會上給出了一個明確的判斷:推理時代,CPU正從“配角”蛻變為整個系統的“控制中樞”。當AI真正開始幹活,算力的定義正在被重寫。

01、數字AI:當智能體規模化,CPU為何重回C位?想要理解CPU的“逆襲”,核心是釐清智能體執行與傳統模型訓練的本質差異。模型訓練是標準化、可並行的批量任務,核心目標是極致提升整體吞吐量;而智能體是典型的串行狀態機,每一步任務執行都依賴上一步的輸出結果,任意環節的微小延遲,都會沿著任務鏈路層層放大,最終影響整體智能體驗。這也意味著,傳統CPU一味追求平均吞吐的優化思路已然過時,穩定、可控、超低的端到端延遲,成為智能體規模化落地的核心硬性約束。不僅如此,智能體場景的硬件負載矛盾愈發突出。

高併發工具調用與高帶寬AI推理任務需要在單芯片內混跑,二者對內存資源的需求相互衝突,疊加多租戶場景下的安全隔離、資源獨佔需求,傳統CPU架構的短板徹底暴露,架構革新與系統重構勢在必行。對於這一難題,英特爾並沒有選擇慣用的單點堆砌參數,而是從系統層面重新劃分數據中心的架構。大會現場,英特爾數據中心集團副總裁、中國區總經理陳葆立表示,“未來的數據中心將被拆分為三類集群:負責智能體執行和任務編排的CPU集群、負責模型推理計算的GPU集群,以及承載長對話、文檔等持續新增業務數據的存儲集群。這三類集群之間的數據調度,全部由CPU完成。

”落到產品上,採用Intel 18A製程、最高擁有288個能效核的至強6+處理器配合智能體套件,單顆即可部署近千個智能體。英特爾表示,這一優勢並不是憑空想象,而是有著實測數據支撐:在SWE-bench測試中,其單智能體性能領先競品15%;在雲端沙箱場景下,面對10分鐘內批量啟動上萬沙箱、單沙箱延遲200ms以內的嚴苛要求,至強6+支持350個沙箱併發,性能約為競品的1.46倍。結論顯而易見:在智能體場景下,性能和響應速度缺一不可。而另一方面,CPU在三個具體環節上的價值也十分突出。

首先是異構數據預處理,智能體需要抓取網頁、視頻、PDF等素材並做文本提取,這類任務GPU並不擅長,而至強AMX加速器讓向量化和重排序分別達到基準的2倍和4倍。其次是存儲調度,從HBM到DRAM再到本地SSD,成本和延遲呈反向變化,CPU作為核心調度者,聯合焱融科技基於至強6和MRDIMM的方案,在MLPerf Storage v3.0中拿下了Llama3檢查點讀寫和3D-Unet訓練兩項全球第一,有效消除了存儲瓶頸。

最後是KV Cache管理,面對百萬Token上下文約300GB的容量,英特爾的KV Cache智能加速套件通過QAT實現無損壓縮,將300GB原始數據壓至200GB,並藉助DSA引擎將數據搬運最高加速9.66倍。把這一系列環節串聯起來,便能得出清晰結論:步入智能體時代,GPU 承載 “智” 的核心推理運算,而 CPU 既要承擔基礎計算,更要扛起全局 “管” 的重任。隨著業務規模擴張,這套調度管控工作的複雜度呈指數級攀升,而這恰恰是英特爾長期積澱形成的獨有優勢。02.物理AI:控制、成本與算法路線的破局 如果說數字AI的戰場在雲端,那麼物理AI的征途則在真實的物理世界。

“我們希望當大家提到物理AI時,第一個想到的廠商是英特爾。” 英特爾副總裁兼端側計算和物理AI事業部中國區總經理高嵩在Connection大會上這樣表態。這句話說起來容易,但落地起來實際難度卻不少。物理AI與數字AI的核心差異在於,機器人必須與真實物理環境交互。行業裡一個現實的痛點是:讓機器人跳舞容易,做精密操作難。這一現象的難點在於控制,對於機器人而言,動態環境下的實時感知與精準執行,目前仍是巨大的瓶頸。第三代酷睿Ultra的應對方案是“大小腦融合”。依託XPU異構架構,推理決策與實時運動執行被整合在單顆SoC上。

其中,CPU作為“小腦”,以4kHz的控制頻率每秒完成4000次動作調整,保障關節電機精準響應;GPU承載高階AI推理,在Pi0.5精度下推理時延僅為78毫秒,低於人類視覺200-250毫秒的平均反應時間;NPU則面向視覺感知,YOLOv12n推理僅需3.55毫秒,每秒處理約280幀,遠超普通攝像頭60幀的輸出上限。傳統方案需要多個獨立單元分工處理感知、決策和控制,不僅響應慢,還容易出現協同偏差。單芯片整合後,工程師得以將精力從底層調優轉移到上層智能開發。在成本方面,具身智能的Token消耗隨用戶量線性增長。某具身企業創始人透露,工程師一下午的訓練就能燒掉數百美元。

對於這一難點,英特爾的思路是通過硬件負載整合降低底層開銷,將推理決策和運動控制統一到單顆SoC的異構架構上,從硬件層面壓縮算力冗餘和能耗,把整體擁有成本拉到可商業化的區間。而在算法路線上,具身領域目前沒有統一範式,世界模型、VLA等路線仍在並行演進。芯片架構設計週期長達兩到三年,押錯路線的代價極其高昂。面對這個問題,不同於很多廠商一味強調"靠近客戶需求",英特爾提供了一個更辯證的思路——不僅要傾聽客戶的聲音,更要有自身的戰略判斷。"我們也希望用我們自己內部的前瞻視角、結合自身的架構優化,與最廣泛的生態進行合作,找準技術落地的正確方向,這是認知智能體發展在當下需要完成的事情。"高嵩表示。

英特爾的差異化策略在於:不盲目追隨單一算法路線,而是以開放的架構和生態,支撐多種算法範式的並行驗證與快速迭代。目前,英特爾已聯合科通工業、神州數碼等合作伙伴推出基於第三代酷睿Ultra平臺的具身智能開發套件,並攜手多傢伙伴面向製造、建築、醫療、智慧城市、倉儲物流、酒店等多種場景推進項目從原型走向量產,以生態的廣度對沖算法路線的不確定性。此次,英特爾也正式宣佈,英特爾具身套件將於11月份在京東上線,也意味著,開發者離觸手可及的機器人又近了一步。寫在最後正如開篇所言,在AI從算得快走向幹得了活的今天,系統設計的重心正在向執行面遷移。

英特爾在數字AI側的判斷是:推理和智能體部署放大了CPU側的系統工作,而x86在控制面、生態適配和基礎設施軟件上的存量優勢,正好能接住這個需求;在物理AI側,則用異構SoC縮短機器人的感知-決策-控制閉環,靠生態廣度對沖算法路線的不確定性。不一定完全會用到所有的算力,但提供一個最優的系統級選擇,也許便是生產力提高的關鍵。當AI真正開始解決現實問題,算力的版圖,已然重塑。

Related

相關文章

鈦媒體生成式AI

RSI概念過熱,一線學者:有炒作成分

AIX財經2026.09.28 15:37 · 來自北京全文7242字00:00 / 21:01人人都在擔心AI失控,我們找了個不慌的人聊了聊。文 | AIX財經(AIXcaijing),作者|陳丹,編輯|魏佳在日行千里的AI行業,一直有人喊“狼來了”。

剛剛

​MiniMax 全新文本模型 M3.1-Flash-Preview 正式公測

9月28日,國內頭部 AI 廠商 MiniMax 官方宣佈,旗下全新文本模型 M3.1-Flash-Preview 正式上線並開啟全面公測。在核心技術與功能特性方面,該模型具備兩大亮點:一是全面支持原生多模態能力,二是擁有百萬級別的超長上下文窗口。

剛剛

OpenAI 重排 Pro 檔位:5x和20x用量承諾下線

原先每月 100 美元和 200 美元的兩檔 Pro 會員,名字分別變成了"Pro Standard"和"Pro More",而最讓用戶介意的是,頁面上原本清清楚楚標著的"用量是 Plus 的 5 倍""用量是 Plus 的 20 倍"兩行字已經消失,取而代之的是一句籠統的"比 Plus 用量更多"。

剛剛