為了智能體AI,高通「新造」了第六代驍龍8超級至尊版

2026年9月23日 23:08
站內 AI 整理稿

“我們正在從以手機為中心的模式,轉向以智能體為中心的新體驗。手機、PC、眼鏡、可穿戴設備以及汽車,都將成為智能體的終端入口。”2026驍龍峰會上,高通公司總裁兼CEO安蒙說。過去二十年,智能手機圍繞App運轉。智能體則需要持續感知、理解上下文、調用工具,並在用戶沒有操作手機時代表用戶執行任務。“這是一次令人興奮的技術變革,智能體AI會創造一種全新的終端工作流程。”安蒙表示,“我們需要重新思考計算引擎的設計。CPU需要更強的性能來完成智能體編排,NPU加速器負責高效的AI推理,GPU負責高度並行的計算,連接能力也比以往任何時候都更加重要。

”高通為智能體AI首次同時推出兩款2nm製程移動旗艦平臺——第六代驍龍8超級至尊版和第六代驍龍8至尊版。高通技術公司高級副總裁兼手機業務總經理Chris Patrick解釋說:“單一標準,已經無法定義旗艦。保持領導力需要不止一條前進道路。”兩款平臺共享多項核心技術,第六代驍龍8超級至尊版位於產品組合頂端,擁有高通最頂級的配置,包括業界首個最高主頻達到5GHz的移動CPU、GPU中首次加入的Matrix Cores(矩陣核心),以及可以運行300億參數MoE模型的NPU。這些升級背後,藏著一個核心問題,智能體全天運行,到底需要怎樣的計算平臺?高通給出的答案,是從智能體AI需求出發重新設計SoC。

高通到底如何圍繞AI,“新造”第六代驍龍8超級至尊版?智能體撞上「內存牆」,高通給CPU、GPU、NPU同時「動刀」第六代驍龍8超級至尊版最醒目的數字是5GHz。但Chris Patrick強調,“速度只是其中一部分,CPU還需要快速訪問數據。”這指向AI難以繞開的內存牆。“端側智能體的主要問題其實還是內存和續航的限制,而非性能的限制。”高通公司產品技術專家朱元堃對表示。模型推理需要持續讀取模型權重、上下文、KV-cache和中間結果。當數據在系統內存與片上存儲之間頻繁往返,數據搬運所需的時間和電量也會影響實際性能。

內存牆的挑戰同時存在於CPU、GPU和NPU,第六代驍龍8超級至尊版如何打破內存牆?最高主頻達到5GHz的Oryon CPU引入全新Oryon FlexCache,讓8個核心訪問同一個共享L2緩存池,並根據工作負載動態分配資源。智能體處理一連串任務時,數據不必在每次任務交接時都從系統內存重新加載,從而減少任務切換和等待時間。這也解釋了5GHz對智能體的真正價值。CPU不僅要快速完成單個任務,還要縮短整條決策鏈中每一次調度和交接的等待時間。頻率決定計算速度,緩存則決定高頻率有多少時間真正用於計算。

Adreno GPU擁有第二代18MB獨立高速顯存HPM,用於保存渲染瓦片、幀緩衝和中間結果,減少圖形管線對系統內存的反覆訪問,可實現功耗降低12%。高通Hexagon NPU的共享內存增加50%,讓模型狀態、上下文和KV-cache更多留在片上,降低外部DDR的訪問頻率。第六代驍龍8超級至尊版還採用LPDDR6內存和UFS 5.0閃存。片上空間無法容納全部模型和長期數據,模型權重可以保存在閃存中,再根據任務加載到內存。從片上緩存、系統內存到閃存,高通正在從系統維度解決內存牆挑戰。但減少數據等待,只解決了智能體計算的一半問題。什麼是為智能體而生的移動計算平臺?

智能體需要持續完成“感知—理解—規劃—執行”的循環,在模型、應用服務、終端設備與雲端資源之間選擇路徑,無法由單一計算單元完成。全天運行的智能體,需要系統級協同。“在智能體時代,驍龍平臺的每個模塊各司其職。”Chris Patrick說。需要調用雲端API時,由CPU完成調度和路由。多個模型在終端同時運行時,NPU與GPU可以共同承擔推理。

在第六代驍龍8超級至尊版上,Oryon CPU負責規劃智能體循環,管理控制流程、任務調度和數據移動;Hexagon NPU運行主要模型,完成推理、內容生成和複雜決策;GPU中的Matrix Cores讓AI直接進入圖形管線;高通傳感器中樞則以較低功耗持續處理語音、活動和個人情境。值得關注的是,高通Hexagon NPU加強了對Transformer的支持。Hexagon Element Accelerator針對Transformer關鍵運算,與向量和標量計算單元共同處理數學計算、邏輯判斷與專家路由,讓全新旗艦平臺支持最高32K Token上下文,在部分模型上的預填充性能提升最高80%。

傳感器中樞的雙Micro NPU在性能提升85%的同時,功耗降低20%,可以在不頻繁喚醒主應用處理器的情況下,持續處理環境語音、用戶活動和個人情境,降低智能體始終在線的功耗成本。第六代驍龍8超級至尊版搭載的Adreno GPU性能最高提升44%,能效最高提升40%,是高通迄今幅度最大的GPU代際躍升,也是高通首次在Adreno GPU中加入Matrix Cores。過去,圖形管線調用神經網絡時,數據通常需要離開GPU交給NPU處理,再把結果送回。Adreno Matrix Cores讓超級分辨率、幀生成等AI任務留在圖形管線中,也可以加速更通用的AI負載。

當AI工作負載不再只由NPU承擔,CPU、GPU和NPU的分工也開始改變。遊戲開發者可以調用GPU中的AI能力,大型、持續運行且對能效敏感的模型更適合使用NPU,CPU則承擔智能體編排、任務調度以及部分AI計算。“真正的突破,不在於某一項技術,而在於這些技術如何協同發揮作用。”Chris Patrick說。這套為智能體AI革新的計算平臺是否有效,最終仍要回到手機上的實際體驗。300億參數MoE上手機,端側AI從單次問答走向智能體工作流第六代驍龍8超級至尊版能夠在端側運行300億參數MoE(混合專家)模型,是最直觀的證明。這一模型每生成一個Token只需激活約30億個路由參數。

300億參數決定模型能夠容納多少知識,30億激活參數則影響一次推理實際需要多少計算,讓模型能力與手機有限的內存、功耗之間出現新的平衡點。但讓300億參數模型真正運行在手機上,仍然需要芯片、推理引擎、模型和存儲廠商共同配合。正如安蒙所說,“高通始終相信強大的合作伙伴關係,我們堅信單一公司無法獨自構建這樣的未來。智能體體驗將催生新的合作伙伴關係,也會帶來新的機遇,這需要合作伙伴的力量。”高通與階躍、無量火、江波龍合作,將StepEdge-Omni 30B-MoE完整部署到手機端。

通過推理引擎、CPU、GPU、NPU異構調度和存算協同,模型運行內存需求較常規方案降低超過50%,預填充速度超過330 Token/s,解碼速度超過28 Token/s,可以在本地完成郵件理解、行程規劃、日曆同步、航班酒店推薦和郵件草擬等連續任務。其中,NPU與GPU雙引擎協同的預填充吞吐性能,相比僅使用NPU的通用推理方案提升超過30%。這組數字更關鍵的意義,是端側AI開始從一次問答進入完整的智能體工作流。傳感器中樞可以在主應用處理器不必頻繁喚醒的情況下持續處理環境信息。個人記錄功能可以在獲得用戶允許後整理對話和重要信息,形成個人知識圖譜。

Adreno Neural Fusion讓AI參與遊戲的超級分辨率和幀生成。Spectra ISP則把圖像和視頻轉化為多模態模型能夠理解的上下文。其第二代AI-ISP架構將視頻吞吐能力提升2倍,並首次在搭載驍龍移動平臺的智能手機上支持8K 60fps視頻拍攝。這些橫跨辦公、遊戲和影像的體驗,都指向同一個方向,AI逐漸成為設備持續運行的一部分。手機既要完成用戶主動發起的工作,也要在用戶沒有操作時代表用戶運行。這比跑出一次漂亮的AI Benchmark(基準測試)更難,因為每一項能力都要放進有限的電量和散熱空間中。“智能手機是唯一能夠以如此大規模將隨身、情境感知和連接這三個要素融為一體的終端。

”Chris Patrick說。所有任務都留在本地並不現實,但與個人情境、隱私和即時響應有關的部分,距離用戶越近,體驗就越自然。手機不是最大的計算中心,卻是最靠近用戶的個人AI入口。從手機到PC,高通開始圍繞「智能體AI」造芯片智能體不會只存在於一部手機裡。PC、耳戴式設備、眼鏡、手錶和汽車承擔不同任務,也需要共享對用戶的理解,讓智能體在設備之間保持連續。手機仍是這套體系的樞紐,它始終隨身,彙集最多個人情境,又連接著應用、其他設備和雲資源。不同終端需要的算力規模不同,但對高通而言底層問題一致,如何用異構計算完成不同任務,又如何通過連接讓智能體在終端和雲端之間保持連續。

高通的計算產品組合正從手機擴展至PC、汽車等智能體終端,並通過連接雲端計算資源,擁有混合AI的完整部劇。而混合AI的關鍵,是讓用戶感知不到任務在不同計算資源之間的切換。這使高通的角色從提供移動計算平臺,進一步延伸到搭建智能體AI的計算底座。“最好的AI,不是向你索取更多,而是替你完成更多,並且它是屬於你的AI。”安蒙說。從App時代進入智能體時代,旗艦SoC的競爭標準也在改變。過去,旗艦SoC的競爭常由CPU和GPU的峰值性能主導。未來還要看一顆芯片能否在內存、功耗和散熱限制之下,讓智能體保持感知、持續推理並完成複雜任務。5GHz和端側運行30B MoE模型,是最容易被看見的結果。

藏在這些數字背後的數據搬運、異構調度與系統能效,才是第六代驍龍8超級至尊版真正被重新設計的部分。AI手機下一階段的競爭,不只是誰能把更大的模型裝進手機,還要看誰能讓智能體在手機有限的內存和功耗中全天運行,並與其他終端和雲端保持連續協同。第六代驍龍8超級至尊版,就是高通對下一代旗艦標準的回答。

Related

相關文章

量子位模型更新

海信新一代性能旗艦E7S Pro+正式發佈,原生真彩再進階

海信發表新一代性能旗艦E7S Pro+,覆蓋75、85及100吋三種尺寸,主打原生真彩RGB-Mini LED技術,並全球首發杜比視界第二代MAX,最高可達XDR Pro 6000nits亮度。新機搭載首個家庭智能伴侶級AIOS「JUOS」,支援51維畫質調校與專屬內容模式,強調從顯示技術到AI交互的完整旗艦體驗。100吋版本零售價21,499元,國補後19,999元。

剛剛
雷峰網模型更新

BAT 集體重做「AI 預訓練」,補「髒數據」的坑

最近大半年,國內一批 AI 模型廠商密集啟動“預訓練返工”,起因都指向同一件事:數據不行。它們中,有的此前花了一年死磕萬億參數模型,落地表現卻被市面上 1% 規模的小模型倒掛,最終查出是被髒數據拖了後腿。有的曾因數據標註規則模糊、評測集汙染、垃圾語料冗餘等工程硬傷而導致模型進展遲緩。還有的因數據受限,導致模型遭遇性能瓶頸,索性推倒重來,並重建了數據團隊。與此同時,借 API 中轉站截留交互軌跡、做數據蒸餾等,也成了行業水面下的一場暗戰。數據,正在給模型廠商上一堂教訓深刻的課。這堂課遠比算力消耗、架構選型和人才爭奪更隱蔽。“AI 下半場的勝負手是數據”,這話聽上去像常識,但直到今天,大家才真正聞到了它背後的血腥味。01數據上的“粗放式彎路”預訓練返工,本質上是在補數據的課。“多就行了”的誤區一位頭部基模公司的數據專家趙翔向雷峰網回憶,前些年剛開始做預訓練的時候,大家的主流觀點是“數據多就可以了,稍微差一點沒關係,模型自己有轉化能力和魯棒性。”於是開始一味地粗放式堆數據,只求規模不講質量。再加上,當時行業普遍缺乏成熟的大規模數據治理體系,大家為了湊齊數千億甚至上萬億 token 的語料庫,抓取了大量網頁垃圾、髒語料,甚至混入了各種來源不明的清洗包。很多數據的標註和篩選也沒有處理好,導致訓練出來的第一版模型效果較差。然後大家才發現,不注重數據質量,會讓模型卡在 60、70 分上不去,“眼看海外的模型都跑到 90 分了,就是追不上。”於是不得不回過頭來重做數據優化。髒數據的代價“底層髒數據的危害遠比想象的大。它會讓你投入的卡、錢、人力都浪費掉,而且還會耽誤你的時間窗口。”某模型廠商前高管、現 AI 創業者王斌告訴雷峰網。他向雷峰網描述過一個典型案例。一家中部基模公司,把爬來的技術博客整批灌進預訓練語料,跑到訓練中期才發現,其中相當部分是採集站的機器生成頁,同一個段落被重複了幾萬次。

1 小時前
MarkTechPost AI模型更新

NVIDIA 發布 Nemotron 3 Diarization:1 億參數開放權重模型,即時分辨 8 位說話者

NVIDIA 在 Hugging Face 上發布了 Nemotron 3 Diarization,這是一個開放權重的說話者分離(diarization)模型,能回答任何對話中的一個關鍵問題:誰在何時說話。這個 1 億參數的模型可追蹤最多 8 位說話者,包括聲音重疊的情況。單一檢查點即可同時處理離線錄音與即時串流。它是否可部署?是的,權重以 OpenMDW License 1.1 發布,允許商業使用。透過 NVIDIA NeMo 在 Linux 上運行,支援 Ampere、Ada Lovelace、Hopper 或 Blackwell GPU。為何需要說話者分離?自動語音辨識(ASR)能提供文字,但無法告訴你誰說了這些話。若缺乏說話者歸屬,摘要系統就無法分辨誰做出承諾、誰提出異議。說話者分離則輸出每個說話者活躍的時間區間。

9 小時前