深度解讀高通下一代驍龍旗艦芯:CPU、GPU、NPU終極AI進化,黑科技拉滿

2026年9月10日 13:05
站內 AI 整理稿

作者 | 雲鵬 編輯 | 漠影 今天,各類智能終端都在向智能體(Agentic AI)方向快速進化,AI加速從雲端走向邊緣,越來越多的AI功能可以在端側高效、快速、安全的實現。用戶只需一句話,智能體就能執行幾十甚至上百步操作完成複雜任務;有時你甚至不需要說話,智能體就能感知你所在的環境、理解你的需求、根據記憶主動提供貼心的服務。而這一切出色端側AI體驗,都離不開底層芯片平臺的紮實支撐,智能體趨勢的到來,也在加速著芯片的進化:更高性能、更低功耗、更強大的端側AI算力、更高效的存儲、更安全的保障,這都是智能體時代的“剛需”。

就在最近,芯片生態巨頭高通再次“亮劍”,提前劇透了即將在2026驍龍峰會上發佈的新一代驍龍旗艦移動平臺將採用的諸多硬核技術升級,揭秘了CPU、GPU、NPU等核心模塊面向AI智能體的一系列能力強化細節。從CPU緩存架構革新突破存儲瓶頸、AI渲染深度集成於圖形管線、GPU專用AI核心的引入到NPU AI計算單元和共享內存的升級,我們看到,新一代驍龍旗艦移動平臺完成了一次圍繞智能體的全面進化,也將成為2026年下半年旗艦AI手機之戰的關鍵底層支撐。一、NPU成智能體時代“剛需”,高通聯合行業頭部構建新一代終端側AI架構 談及AI時代芯片變革,NPU的進化始終是行業核心議題。

相比CPU、GPU這兩個更基礎、發展歷史更長久、更成熟的SoC組成單元,NPU的發展從源頭就與AI強相關——‌Neural Processing Unit‌,神經網絡處理單元,也因此NPU在智能體時代幾乎成為智能終端在算力層的“標配”。從智能體理解用戶個人情境、跨應用協同運行持續推理,到根據用戶意圖完成操作。AI在端側的高效落地,離不開出色NPU能力的支撐,離不開NPU與CPU、GPU等模塊之間形成高效協同的異構計算系統。尤其在當下的智能體浪潮中,AI不僅需要更強的推理能力,還需要持續低功耗運行、全天候感知、多模態、低時延等諸多特性的支撐。

這一趨勢下,高通將在新一代旗艦平臺上發佈新的Hexagon NPU和兩項關鍵技術創新,包括新的Element Accelerator和更大的共享內存系統。據瞭解,Element Accelerator專為生成式AI和智能體AI的Transformer工作負載打造,其結合向量計算單元和標量計算單元,能加速大模型中最關鍵的運算,讓智能體更快地響應、更高效地推理,同時兼顧能效表現。此外,Hexagon NPU擴展了大容量共享內存,可以讓模型狀態、上下文信息和KV-cache數據存儲在更靠近AI計算單元的位置,進而緩解內存瓶頸。

這樣一來,智能體在處理更長上下文、調用更多工具以及執行更多併發任務時就可以運行更流暢響應更及時、實現更快token生成速度,可以用更少的等待時間完成回答、修訂、規劃和執行,這對AI智能體體驗的提升非常重要。值得一提的是,高通正與行業頭部內存和模型廠商合作,引入混合專家模型(Mixture-of-Experts,MoE)構建新一代終端側AI架構。簡單來說就是在兼顧模型性能質量的同時降低模型對存儲的消耗:一個300億參數的MoE模型可以在保持數百億參數可用的同時,在NPU上每次生成一個詞元,僅需激活約30億個被路由選中的參數。

MoE會根據輸入動態選擇專用專家網絡,從而減少實際計算負載和內存帶寬需求,結合智能的專家模塊閃存到內存加載管理機制與緩存技術,以低功耗和低內存需求實現更大模型級別的AI體驗,頗有“事半功倍”的效果。同時,對INT2、INT4、INT8、FP8和FP16的支持,讓開發者能更靈活地在性能、內存、模型質量和功耗之間取得平衡。對於基於INT4的模型,Hexagon NPU可以實現最高50%的預填充性能提升、更快的解碼吞吐速度、增強的推測解碼、更快的詞元生成速度。直觀效果就是,智能體響應更快、性能更強、結果更個性化,首次生成時間低於1.5秒,近乎即時交互。

總體來看,新一代Hexagon NPU融合了計算性能、存儲架構、靈活性等多方面創新,形成了由Element Accelerator、向量和標量計算單元、更大的共享內存以及基於閃存的模型加載機制共同構成的協同架構,在支撐智能體AI端側落地方面起到了關鍵作用。二、5GHz高主頻、動態緩存架構創新,Oryon CPU讓智能體有個“強大腦” 在AI大模型剛剛誕生之初,AI生成文字、圖片是主要用例,那時AI應用的需求更多側重GPU,而在智能體時代,海量複雜任務的拆解、規劃執行,海量數據的感知、處理、分析,都對CPU提出了更高要求。

用高通的話來說,CPU是定義整個平臺的核心基礎,也是決定整體性能表現的關鍵所在。在硬核峰值性能方面,這一代Oryon CPU成為了業內首個最高主頻達到5GHz的移動CPU。值得注意的是,這一極高的主頻並非僅依靠先進製程工藝實現,高通為其進行了完整的定製化設計,從CPU內核的微架構、落地方案到CPU子系統,研發團隊對每個組件都進行了精細調校,最終突破移動芯片限制,實現5GHz主頻。在高主頻基礎上,新一代Oryon CPU的關鍵IPC性能也進一步提升,兩者相結合,讓手機在啟動App、網頁、遊戲、內容創作等場景都更流暢,同時讓手機在處理智能體AI需求時,CPU的每一次調度、協調、複雜計算都更高效。

眾所周知,緩存對IPC的表現至關重要。從智能體規劃任務調用工具到多任務多線程並行進行,這些場景涉及大量數據訪問,都對緩存有高要求。為此,高通在下一代旗艦移動平臺中引入了新的動態緩存架構Qualcomm Oryon FlexCache,實現“定製化”的CPU體驗,其支持異構計算核心訪問相同的緩存池,系統可以根據工作負載動態調整分配緩存資源。面對高負載任務,超級內核可以充分利用整個緩存池,峰值性能可以更持久的釋放。在當前行業普遍面臨存儲供應短缺的背景下,這項技術的創新意義尤為凸顯:FlexCache減少了核心訪問系統內存的頻率,因此即使在內存資源受限的情況下,CPU也能提供穩定的性能表現。

在AI智能體時代,FlexCache的重要性更加突出。智能體往往會執行一連串任務,不同任務步驟需要跨不同核心輪流執行。由於所有核心共享同一緩存空間,任務切換過程中相關數據依然保留在緩存中,無需重複加載,智能體能夠更高效地在不同核心間協同運行。從CPU主頻、IPC核心性能的大幅提升,到FlexCache緩存架構層的顛覆式升級,新一代Oryon CPU可以說給智能體時代的旗艦移動平臺夯實了根基。新的Oryon CPU會在智能體工作流中承擔更多的編排規劃工作,統籌平臺各類計算資源、協調工作流,並根據智能體的需求調用相應工具,讓AI手機可以更好地應對更復雜、更有挑戰的AI應用需求。

三、把AI專用核心塞入GPU,AI顛覆遊戲體驗的時代已經來了 聊完了CPU,我們將目光聚焦於GPU。今天,AI遊戲時代儼然已經到來,AI愈發深度地與遊戲開發、遊戲玩法相結合。前不久PC端側發佈的DLSS 5技術,將AI模型深度融入圖形渲染管線,對端側遊戲市場帶來顛覆性衝擊。而在移動遊戲市場,必然需要高通這樣的芯片玩家來推動AI變革的落地。在高通看來,移動遊戲行業十年來一直在追求三件事:主機級的畫質、穩定的幀率,以及出色的電池續航。在過去的大部分時間裡,用戶只能選其二。而高通通過結合AI、專用芯片和先進內存架構,力圖讓這三件事得以兼得。為此,高通在GPU層面祭出多項硬核技術大招。

首先是AI圖形渲染技術——Adreno Neural Fusion,這一技術將神經處理、AI超分和幀生成統一整合到單一圖形管線中,可以在降低渲染成本和功耗的同時,實現更高的視覺質量,可以說是既要又要了。值得一提的是,高通還第一次將專用於AI的GPU核心Adreno Matrix Cores引入圖形管線,搭配18MB的Adreno獨立高速顯存(HPM),實現AI工作負載的本地處理,從而降低延遲、延長遊戲時的手機續航時間。縱觀行業,英偉達、蘋果公司分別在2017年、2025年給自家GPU中加入了專用的AI核心,前者是Tensor Core,後者是Neural Accelerator。

高通的入場進一步證明,這已經是行業頭部玩家共識的GPU迭代重要方向之一。高通技術公司產品市場高級總監Cisco Cheng提到,新一代高通Adreno GPU在圖形性能和能效兩方面都實現了迄今為止最大的代際提升。與之前的解決方案相比,Adreno Neural Fusion提供了更好的圖像質量,減少了畫質瑕疵,提升了幀穩定性,並保持細節銳利清晰。引入Adreno Matrix Cores也是非常關鍵的一步,這是一組專為AI設計的GPU核心,能在圖形管線內直接運行AI模型。藉此,開發者可以以更低的延遲和更小的功耗開銷運行日益複雜的渲染模型,神經計算不再需要離開圖形管線去別處完成。

高通稱這是其AI路線圖上的一個重要里程碑:從NPU、CPU到GPU,驍龍平臺中的每個核心引擎都已得到Matrix加速能力的加持。當然,GPU在AI任務處理方面同樣離不開高效存儲的支撐。Adreno Matrix Cores搭配了18MB的專用優化緩存——Adreno獨立高速顯存(HPM),集成於Adreno GPU平臺中。HPM為GPU提供了大容量、低延遲的直接內存訪問,讓基於圖塊的渲染、幀緩衝和計算工作負載可以留在圖形子系統內部處理。更少的數據傳輸意味著更低的延遲、更高的效率。對開發者而言,採用率和性能同樣重要。

Adreno Neural Fusion是同類中首個獲得主流遊戲引擎支持並已商用的移動AI超分技術。Adreno Neural Fusion目前已獲得Unity和Unreal Engine兩大主流遊戲引擎的支持。據瞭解,高通會在今年的驍龍峰會上揭曉所有支持並率先採用這一技術的遊戲,其中部分將於今年實現商用。隨著未來越來越多遊戲採用Adreno Neural Fusion,在AI加持下,搭載驍龍平臺的設備會在遊戲方面獲得更好畫質、更流暢遊戲體驗和更高能效。AI給移動遊戲體驗帶來顛覆式升級,已成必然。

結語:旗艦芯圍繞AI深度進化,高通全力衝刺Agent時代 從NPU、CPU到GPU,高通旗艦平臺核心模塊的諸多技術升級都直指智能體時代端側AI落地的關鍵痛點,如何讓AI在端側跑的“多快好省”,高通可以說給行業拋出了新的高效解法。在智能體時代,傳感器中樞始終保持環境語音感知,SoC其餘模塊則按需喚醒,各司其職:Oryon CPU負責指揮、規劃、推理,並協調整個工作流程,Hexagon NPU和Adreno GPU共同承擔AI推理,高通的思路十分明確。

面向未來智能體時代的智能終端大戰,高通已經給行業築牢了紮實的底層算力平臺,基於其上,各家大廠會亮出怎樣的旗艦AI產品,端側AI體驗又會迎來怎樣的革新?我們拭目以待。

Related

相關文章

IT之家AI Agent

長安汽車首席專家譚歡:未來要用機器人造車、賣車,讓機器人上車、造機器人

作者:清源 責編:清源 評論: 9 月 18 日消息,在今天(18 日)的第 22 屆中國汽車產業發展(泰達)國際論壇“新賽道生態專場:具身智能新賽道”活動中,長安汽車首席專家、長安天樞智能機器人公司總經理譚歡在演講中指出,AI 正推動以物理具身智能為核心的基礎設施革新,汽車未來形態是“汽車機器人”—— 自學習、自組織、自進化的組合智能體。

2 小時前
量子位AI Agent

具身智能技術路線尚未定型,基礎設施卻先收斂

具身智能技術路線尚未成形,但基礎設施需求已開始收斂,重點從製造機器人轉向持續迭代機器人能力。百度集團沈抖指出,智能體能力邊界快速擴展,進入規模化部署階段,但機器人學習新任務與跨環境適應性仍待突破。

3 小時前

88小時抵一個人思考4000年,OpenAI核心研究員:除了自我進化,更可怕的是AI正學會“隱藏自己”

AI正在把4000年的人類認知勞動壓縮進88小時,OpenAI研究員Noam Brown坦言連他自己也被進展速度持續震驚。AI正在把過去需要數千年完成的認知勞動壓縮到數天。真正的問題已經不只是模型能否變得更聰明,而是實驗能否跟上、人類能否在模型繼續自我改進前確認它仍然安全。

3 小時前
智東西AI Agent

Agent辦事、花式P圖、動嘴玩電腦……實測Wildcat Lake輕薄本玩AI有多爽

作者 | ZeR0 編輯 | 漠影 桂林依山傍水,連城市的輪廓,都是一座座山勾勒出來的。抬眼一望,便是翰墨丹青般的自然光景,既沉靜婉約,又意境悠遠。這種乾淨的留白之美,早已被古人融入山水畫藝中,幾筆山石,一帶煙雲,餘下的留給水色,也留給看畫的人。 淨,並非空無一物,而是通過剋制的取捨,讓真正重要的東西凸顯出來。這與今年推出的第三代英特爾酷睿處理器(代號Wildcat Lake)的設計理念不謀而合。

9 小時前
AIbaseAI Agent

吳恩達回應AI末日論:別被科幻敘事帶偏,應解決現實工程問題

吳恩達曾參與創辦Google Brain和Coursera。吳恩達稱,科技行業早期曾放大AI潛在災難性風險,以獲取關注並影響監管方向;近兩週相關討論再次升溫,也可能存在類似動機。他認為AI確實存在現實風險,尤其包括網絡安全等領域,但不認同將人類滅絕風險作為當前AI發展的核心判斷依據。

10 小時前
IT之家AI Agent

智譜 GLM-5.3-FlashX 模型上線,更快、更流暢

作者:汪淼 責編:汪淼 評論: 感謝網友 Agent 的線索投遞!9 月 18 日消息,智譜今日宣佈推出 GLM-5.3-FlashX(最高 200 tokens/s),為企業與開發者帶來更快、更流暢的模型體驗。智譜官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名與全球開發者見面,獲得海內外開發者的廣泛認可,調用量持續攀升。

12 小時前