Imagination E系列性能首秀:用AI把分辨率翻倍僅需2.3毫秒,Prefill性能提升4.7倍
作者 | 陳悅琳編輯 | 包永剛 越來越繁重的AI計算正被引入終端。運行本地大模型和Agent、同時處理視覺、語音和多種傳感器數據……這些開始由消費電子、汽車、機器人等智能終端承擔的新負載,最終都要交付給底層的SoC來執行。要麼引入新的專用AI加速器,要麼擴展系統內已有模塊的職責——圍繞AI能力如何融入SoC,Imagination Technologies(以下簡稱“Imagination”)兩條路都走過。在此前CNN主導大量端側視覺AI任務的時期,這家深耕GPU IP三十餘年的公司既嘗試讓GPU參與AI計算,也推出過獨立的神經網絡加速器。
然而,當模型、算子和軟件生態持續變化,Imagination開始意識到專用硬件對模型適配和軟件維護的不堪重負,逐漸把AI戰略重心收回至通用性更強的GPU。日前在Imagination GPU IP最新E系列的產品展示會上,Imagination首席營收官Jake Kochnowicz再次強調,在真實部署裡,軟件甚至可能成為比硬件更大的成本。基於GPU的可編程架構和已有軟件生態,瞄準高性能應用的E-Series強化了矩陣乘法、低精度計算、卷積運算等能力,一邊承接新的AI負載,另一邊也持續押注圖形處理這一GPU的老本行。
Imagination CEO Markus Mosen總結:“通過將圖形、計算和AI功能整合到一個可編程架構中,我們為芯片設計廠商提供了一款值得長期構建和演進的平臺型處理器。” 這意味著,Imagination真正想驗證的是,當一顆GPU開始覆蓋越來越多AI任務,能否藉助同一套硬件和軟件體系,讓算力利用得更充分、數據少搬一些,軟件開發和維護也少做一些重複工作。3A桌面遊戲幀率突破60FPS,離不開一顆神經核E系列強化AI能力後,用戶最容易感知到的變化,仍然發生在GPU擅長的遊戲場景。憑藉四核E-Series,部分3A級桌面遊戲的幀率可以超過60FPS。
提高幀率的其中一條路徑,是減輕傳統圖形渲染的負擔。引入Neural Core(神經核)的E系列,用AI超分技術來實現這一目標。相比原生高分辨率渲染需要直接生成更密集的畫面信息,AI超分的方式允許GPU先按較低分辨率渲染,再由神經網絡重建高分辨率畫面。Jake指出,傳統異構路徑會選擇讓GPU負責渲染、NPU(神經網絡處理器)負責超分,這意味著圖像可能需要先寫入共享的DDR內存後再由NPU讀出、處理並寫回。而E系列直接讓GPU自身獨自承擔圖形計算和矩陣運算,大大縮減了距離成本。
與此同時,Imagination還進一步打通E系列內部兩類計算單元的“最後一公里”,將矩陣計算能力深度整合進原有著色器執行體系,圖形計算產生的數據可以就近進入矩陣運算。硬件架構之外,結合其獨有的壓縮技術,Imagination自研的神經超分辨率算法在單次神經網絡處理中可以降低超一半的權重,減少模型需要存儲和讀取的數據量。種種優化也體現在具體的遊戲體驗中:單核E系列將畫面從540p提升至1080p時,僅耗時2.3毫秒;在同一配置下,畫面繼續拉昇至4K時,帶寬消耗最高降低54%,幀率最高達到對照結果的2.5倍。
這樣的效果也與E-Series繼續沿用的TBDR(Tile-Based Deferred Rendering,基於分塊的延遲渲染)處理有關。Jake解釋,相比部分友商將整幀畫面一次性展開處理,這種處理方式先把屏幕拆成大量Tile逐塊渲染,讓更多中間數據留在片上。此外,這套分塊思路又可以和AI能力結合,圍繞同一個Tile接連完成圖形和神經網絡處理,進一步減少中間結果頻繁進出外部內存。數據搬運被反覆提及,既切中用戶對低延遲的要求,也關乎邊端設備最在意的功耗。除了植入神經核以及其配套的算法外,E系列的亮點還在於對GPU內部ALU(算術邏輯單元)執行機制的改造。
通過把相關運算組織成連續的一組工作交給ALU,中間結果可以更多留在計算單元內部,減少反覆訪問寄存器和搬運數據。Jake將其概括為“最大化數據複用、最小化不必要的數據搬運”,並稱其由此帶來最高39%的每瓦性能提升。新增低位寬計算,Prefill性能提升4.7倍除了支撐遊戲中的AI超分,E系列的AI計算能力還瞄準了當下最熱的AI負載——Agent應用。在Agent一系列工作任務背後,大語言模型推理仍是核心。
具體到模型推理階段,Prefill階段直接影響TTFT(Time To First Token,首Token延遲),Decode階段的運算則關乎TPOT(Time Per Output Token,每Token輸出時間)。兩種任務模式截然不同,卻都指向“讓Token儘可能快地吞吐”這一目標。而E系列的低精度矩陣計算能力,恰好能同時服務這兩個階段。據Jake介紹,E系列第一次引入LLM和大模型推理常用的MXFP8、MXFP4等低精度格式。在相應硬件支持下,較低位寬可以提高矩陣運算吞吐,幫助Prefill更快處理輸入。
據Imagination測算,相比上一代產品,E系列Prefill階段表現提升了4.7倍。在採用低精度量化後,模型權重以及部分中間數據佔用的字節數也會下降,每一步需要讀取的數據隨之減少,從而緩解Decode階段的帶寬壓力。不過,實際系統能提供多少帶寬,仍取決於最終採用的內存、控制器和SoC配置。E系列可通過AXI(Advanced eXtensible Interface,高級可擴展接口)接入SoC內存子系統,適配LPDDR、GDDR和HBM等不同內存,最高可消耗768GB/s的讀取帶寬。除了運行語言模型之外,智能終端還需要同時處理文字、圖像、語音以及傳感器信息。
雖然矩陣運算仍然佔據重要位置,但視覺識別、感知和圖像處理等多模態AI處理又會大量涉及另一項AI基礎運算——卷積計算,因此E系列同步提升此項能力,性能是上一代的4.4倍。軟件棧可靈活調優,但GPU還是需要「搭子」從語言模型到多模態任務,E系列都保留了足夠的通用性,具體到不同模型,開發者仍需要針對算子、精度和執行方式繼續優化。Jake介紹,目前開發者可以通過OpenCL、Vulkan編寫Kernel(計算內核),也可以接入Llama.cpp、ONNX、PyTorch等更上層的軟件生態。
雖然模型還在演進,但Imagination希望藉助跨代統一的軟件棧,讓這些優化能夠繼續遷移和複用,而不是每換一代GPU都要從頭再來。當GPU能夠處理更多AI任務後,這種軟件連續性又開始影響SoC裡的硬件分工。Jake觀察到,一些嵌入式SoC客戶已經開始詢問GPU能否接手部分原本交給NPU的工作,避免為另一類加速器單獨開發、適配和長期維護軟件。但仍需要強調的是,不同任務仍有各自更合適的計算單元。Jake首先以Agent PC為例,指出CPU負責驅動GPU和NPU、協調工具調用、管理數據和任務流程,進入模型計算後,再由GPU或其他AI處理器承擔加速。
在自動駕駛和機器人等更復雜的終端裡,GPU同樣只是異構SoC中的一環,還需要和其他感知、控制及專用計算單元配合。E系列也已經為這種分工做足準備,如用硬件mailbox傳遞狀態和指令;通過共享內存減少重複拷貝數據,並縮短任務從一個處理器切換到另一個處理器的等待時間;此外,客戶還可以把GPU軟件集成進自己的SDK,由系統軟件根據任務特點調用不同計算資源。在對的時間、用對的處理器、出對的結果,併發揮GPU在融合計算中的最大作用,這才是Imagination E系列押注GPU的本質所在。
Related
相關文章

千問創作上線 7 天會員:200 積分 + 快速通道,瞄準旅行出片等即時創作
用戶購買後,可獲得 200 積分、專享快速生成通道,以及新模型與新功能的優先體驗權益。短週期降低嚐鮮門檻相較於包月訂閱,7 天會員以更短的使用週期,明顯降低了用戶的嘗試與決策門檻。對那些只想在一段旅行、一場活動或一輪社媒運營中集中用 AI 出圖、寫文案的用戶來說,不必為長期訂閱買單,也能解鎖快速生成與搶先體驗等核心權益。

千問APP支持中國移動算力套餐,用戶可在工作助理中啟用
已訂閱中國移動該服務的用戶,可在千問APP或PC端的「工作助理」中,使用中國移動賬戶中的Token額度完成複雜工作任務,相關Token將從本人對應賬戶中扣除。同時,雙方還推出了“千問X中國移動聯名版”,用戶辦理指定套餐,即可獲得千問會員權益。

從端側推理到物理AI,芯片行業正面臨新考題
Leo張ToB雜談2026.09.28 10:54 · 來自北京全文4241字00:00 / 12:35物理AI的時代,比拼的將是誰的落地更穩。過去兩年,幾乎所有關於AI的討論都圍繞一個詞展開:規模。更大的模型、更多的參數、更貴的訓練集群。

Muse 登頂、Meta 股價漲 11%,國內大模型卻擠在辦公內卷裡
ICT解讀者一老解2026.09.28 10:33 · 來自北京全文3748字00:00 / 10:50當所有玩家擠在辦公賽道內卷時,C 端場景仍有值得挖的空間。文 | ICT解讀者—老解9月8日,Meta 推出個人 AI 智能體 Muse。上線約 5 天,美國下載量突破73 萬次;上週五(9月18日)它把 ChatGPT 拉下馬,登頂美國 iOS 免費應用榜,並一直佔著第一。受此帶動,Meta 股價週一大漲超過11%,引領美股算力板塊集體走強。

Claude Sonnet 5.5 配置標識符現身並開啟灰度測試,性能直逼 GPT-6 Astra
從多位內測用戶的實測數據來看,Sonnet5.5的綜合表現極為驚豔。在純前端 UI 動畫生成及日常編碼測試中,它展現出了超強的代碼直覺和自然的人機互動質感,其實測表現不僅全面超越了 OpenAI 近期發佈的 GPT-6Sol,甚至在部分高級編碼與智能體能力上直逼 OpenAI 的旗艦大杯 GPT-6Astra。

自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論
研究團隊專門挑選了極易引發模型幻覺的精細冷門問題進行測試,結果顯示,在無AI輔助的對照組中,參與者對36%至44%的問題選擇放棄作答;而在獲取AI建議後,這一不作答比例驟降至3%至6%。更為矛盾的是,在AI輔助下,參與者的答題自信心從29.