從端側推理到物理AI,芯片行業正面臨新考題

Leo張ToB雜談2026.09.28 10:54 · 來自北京全文4241字00:00 / 12:35物理AI的時代,比拼的將是誰的落地更穩。過去兩年,幾乎所有關於AI的討論都圍繞一個詞展開:規模。更大的模型、更多的參數、更貴的訓練集群。但2025年到2026年之間,風向悄悄變了。物理AI、端側AI逐漸成為AI應用的落腳點,產業界談論的焦點正在從AI能做什麼,轉向AI能落在哪裡、怎麼落地、由誰來承載。當AI從數據中心走向口袋、車間和街頭,它面對的不再是穩定的供電、充沛的帶寬和恆溫的機房,而是有限的電池、時斷時續的網絡和嚴苛的實時性要求。場景優先的端側AI走到了哪一步?
根據CounterPoint Research的統計,2025年全球人形機器人裝機量中,中國佔比已超過80%;IDC的數據則顯示,2025年中國具身智能機器人用戶支出規模約為14億美元,預計到2030年將達770億美元,年均複合增長率約94%。把鏡頭從機器人拉回到更廣義的端側AI,滲透的速度同樣在加快。IDC 的統計口徑下,2025 年全球AI PC出貨量約1.14億臺,滲透率約43%;Gartner 預計 2026 年這一數字將升至約1.43億臺,滲透率超過 55%。換句話說,AI正在從數據中心裡那種問答形態,變成部署在人們生活中各種場景中的形態。
但在英特爾公司副總裁兼端側計算和物理AI事業部中國區總經理高嵩看來,物理AI與以大模型為代表的數字AI,有著本質的不同。“從數字AI到物理AI,出現了一些新的變化。數字AI有相對固定的套路,但物理世界沒有統一的形態,行業不同、場景不同、任務不同,催生了千變萬化的全新機遇,”高嵩指出。高嵩將這種不同概括為“千變萬化”。數字AI可以在互聯網上低成本地收集海量數據,把幾千年前的歷史都“喂”進訓練集;但物理世界的歷史你看不見,邊緣的世界也不容易獲取。更麻煩的是,物理AI不能只做一件事,比如現在困擾很多具身智能企業的一個事實:在某個場景訓練好的機器人,換個環境就失靈了。
Figure AI最近發佈的一項研究恰好印證了這一點:通過特殊的訓練方法、不同的數據採集方式和模型架構,機器人進入未經訓練的新場景的成功率可以從9%提升到56%。從9%到56%是巨大的進步,但距離“可部署、可複製、可量產”,依然隔著相當的距離。端側AI的故事則更為現實。英特爾行業及解決方案業務部總經理王景佳與我們分享了一個具體的例子:汽車導航場景。現在很多車都可以完成語音問答和交流,但團隊近期在川西發現,導航可能存在不工作的情況,再碰上覆雜的路況,用戶體驗會受到明顯影響。“對於許多行業場景而言,無網或弱網環境下仍能穩定運行,是一項重要能力。”王景佳強調。
隨著雲端大模型的吞吐效率越來越高、Token單價持續下探,一度有觀點認為,端側AI的性價比優勢正在消失。但一線的實踐給出了不同的答案。視源股份商用顯示BG副總裁王玉龍算了一筆賬:Token的單價確實在降,但真正要輸出好的效果,需要的上下文在快速擴張。“以前的Token是一句話的Token,現在一句話後面要帶著大量的上下文,所需的Token數量是快速增長的。”他透露,視源自己每月的AI賬單就“非常恐怖”。在端側部署算力,可以極大降低用戶的真實使用成本,也為隱私數據安全提供更好的保障。當然,除了成本之外,端側部署的另一個好處就是安全可靠。
以零售場景為例,商米科技執行董事、產品線總經理陳桂鴻告訴我們,門店運營管理裡,點餐時用戶希望商品能及時加入購物車進入結算流程,如果完全依賴雲端服務,就會受到網絡帶寬和穩定性的影響。而在數據安全和實時性之外,端側還有隱私的剛需。視源股份的“課堂觀察”產品就是典型:學生是未成年人,未成年人隱私受法律嚴格保護,所有課堂採集的數據都在班裡做預處理,上傳雲端的是脫敏後的數據。於是,一個越來越清晰的共識正在產業鏈上形成:雲、邊、端不是替代關係,而是融合關係。而物理AI,則把這種融合推向了更極端的形態。
高嵩舉了一個客戶的故事:一家電能領域的公司,面臨裝配的難題,機器人要模擬一個空間的仿真,根據仿真結果規劃整個安裝流程,比如需要先擰一根線纜,下一個螺絲才有空間將工具伸進去。客戶的要求是在做硬件設計、畫電路板和元器件選型的時候,就要同步仿真。這實際上是把所有後端的工作放到前端來做了,“物理AI對算力和工作流的要求,正在向前所未有的深度和廣度蔓延。”高嵩如是說。端側AI給芯片出了新題端側AI、物理AI的發展,一方面是帶來了更大的產業機會與市場空間,另一方面,也是給芯片廠商出了新考題。第一道題就是帶寬與距離成本。AI推理的瓶頸,往往不在算力本身,而在數據搬運。
Imagination CEO Markus Mosen(馬庫斯·莫森)用了一個形象的比喻:把GPU、DSP、NPU等專用加速器塞進SoC,各個部件之間要通過外部內存來回傳數據,而外部內存是昂貴的。馬庫斯·莫森將這種昂貴的數據通信叫作"邊境稅",每個部件像一座孤島,孤島之間用最貴的方式連起來。神經渲染就是這種距離成本最好的例證:GPU出圖形數據,AI再把這份數據加工成更高分辨率的圖,如果圖形和AI完全分開、各自寫回DDR再讀出來,代價極高。Imagination給出的解法,是讓AI直接"長"進圖形管線,而不是放在總線另一端。
NSR(Neural Super Resolution,神經超分辨率)技術走的就是這條路:GPU先渲染出低分辨率畫面,再由片上AI把畫面放大到高分辨率,中間數據不必在GPU和外部內存之間來回倒騰。以540p到1080p的超分為例,在1GHz單核E系列GPU上延遲低至2.3毫秒;與原生渲染相比,NSR在顯著提升幀率的同時,把內存帶寬消耗直接減半。同樣一幀高清畫面,只用一半的帶寬就拿到了。"邊境稅"就此被省下一大截。第二道題就是prefill(預填充)與decode(解碼)之間的取捨。本地大模型,工作負載要分預填充、解碼兩個階段。
最重要的是prefill要在儘量短的時間裡給大模型處理海量數據,衡量指標是Time to first token(TTFT)(也就是處理器聽懂你的問題、開始吐第一個token要多久)。Imagination給出的實測數據頗具代表性:車載規劃行程,TTFT大概0.2秒、150 tokens/s;盲人智能眼鏡描述周圍環境,TTFT約0.25秒、153 tokens/s;郵件解讀和摘要,TTFT 0.86秒、約126 tokens/s。而decode階段則取決於系統帶寬——這也解釋了為什麼AI不只是看TOPS,系統帶寬受限時,更多TOPS解決不了系統問題。第三道題就是綜合能力的平衡。
王景佳總結了過去兩三年客戶合作中最深的體會:“早期討論雲邊端協同、端側AI,更多是從AI技術本身出發。但是我們越來越發現端側AI部署不僅是成本問題,而是需要綜合考慮服務器、時延、響應、成本、隱私安全等多個維度。”尤其在中國獨特的商業和技術生態中,越來越多的商業場景客戶,會更依賴邊緣部署或雲邊端混合部署。比如,端側設備不是算力越大越好,而是要匹配場景。針對此,王玉龍與我們分享了視源應用的經驗:在視源的課堂觀察場景,本地只需要用一個小模型進行快速處理,“32-48TOPS基本可以滿足本地需求,沒有必要部署一個特別大規模的模型,”王玉龍指出。
這種夠用就好的思路,正在倒逼芯片廠商提供更細顆粒度的產品組合。此外,端側設備不同於數據中心內部的設備,其所處環境不盡相同,“行業場景與傳統消費級場景也存在差異,例如7×24小時運行、低功耗、防塵、防震、電磁兼容等各個方面,這些並非僅靠傳統終端設備即可完全滿足。”王景佳指出。同時,智能體的興起改變了工作負載的結構:一方面,推理需求越來越多,從訓練到推理,很多工作負載在推理側產生已經成為現實;另一方面,在整個智能體的部署、調度和運行過程中,會涉及大量由CPU承擔的操作和處理——這一趨勢在雲端、消費級、企業級以及行業場景中都有所體現。
混合式AI時代來了面對新考題,英特爾給出的答案是:通過XPU為分層的負載準備分層的算力。端側的工作負載已經高度分層,智能體的編排調度壓在CPU上,視覺感知這類專用負載適合NPU,世界模型和VLA這類大模型推理則需要GPU的矩陣運算能力。王景佳指出,這正是英特爾近年來押注XPU架構的原因:“我們發現有不同物理AI場景對於計算能力有不同的要求,這也是我們近年來觀察到XPU架構較適用於物理AI和邊緣AI場景的原因之一。”英特爾要做的不只是提供一顆顆單獨的芯片,而是讓同一套軟件框架對不同的計算組件進行統一編程、調度,發揮最大效率。而這個思路目前已經有成功的案例。
在近日舉辦的Intel Connection上,英特爾分享了與派茲互連的合作。雙方以英特爾Agent Box的方式,為客戶提供了軟硬件一體的解決方案:基於CPU加GPU(銳炫Pro B70)的配置,根據客戶的並行情況和工作負載情況重新調校模型、做模型適配和算法調校。而與之相應的,英特爾這兩年在混合AI方面也進行了諸多嘗試。再被問及英特爾未來一到兩年的核心規劃時,王景佳給出了兩個方向:“第一,混合AI的趨勢越來越清晰了,客戶隨著技術發展需要更大算力的產品,需要一個更均衡的產品,需要在設備側、端側、雲側有一個完整的可以調度不同算力、不同需求的解決方案。
第二,AI行業發展非常快,芯片行業是一個硬件行業,它如何快速迭代去跟進這樣一個快速的發展,這也是我們的重點,包括和生態的協同”。這兩個方向,恰好對應了“雲、邊、端如何分工”的行業難題。如果說數字AI的時代,比拼的是誰的模型更強,那麼物理AI的時代,比拼的將是誰的落地更穩。正如高嵩所說:“AI不能只停留在口頭上。我們想要做的事情在物理AI上就是把它落到實處。”(文|Leo張ToB雜談,作者|張申宇,編輯丨楊林)
Related
相關文章

千問創作上線 7 天會員:200 積分 + 快速通道,瞄準旅行出片等即時創作
用戶購買後,可獲得 200 積分、專享快速生成通道,以及新模型與新功能的優先體驗權益。短週期降低嚐鮮門檻相較於包月訂閱,7 天會員以更短的使用週期,明顯降低了用戶的嘗試與決策門檻。對那些只想在一段旅行、一場活動或一輪社媒運營中集中用 AI 出圖、寫文案的用戶來說,不必為長期訂閱買單,也能解鎖快速生成與搶先體驗等核心權益。

千問APP支持中國移動算力套餐,用戶可在工作助理中啟用
已訂閱中國移動該服務的用戶,可在千問APP或PC端的「工作助理」中,使用中國移動賬戶中的Token額度完成複雜工作任務,相關Token將從本人對應賬戶中扣除。同時,雙方還推出了“千問X中國移動聯名版”,用戶辦理指定套餐,即可獲得千問會員權益。

Muse 登頂、Meta 股價漲 11%,國內大模型卻擠在辦公內卷裡
ICT解讀者一老解2026.09.28 10:33 · 來自北京全文3748字00:00 / 10:50當所有玩家擠在辦公賽道內卷時,C 端場景仍有值得挖的空間。文 | ICT解讀者—老解9月8日,Meta 推出個人 AI 智能體 Muse。上線約 5 天,美國下載量突破73 萬次;上週五(9月18日)它把 ChatGPT 拉下馬,登頂美國 iOS 免費應用榜,並一直佔著第一。受此帶動,Meta 股價週一大漲超過11%,引領美股算力板塊集體走強。

Claude Sonnet 5.5 配置標識符現身並開啟灰度測試,性能直逼 GPT-6 Astra
從多位內測用戶的實測數據來看,Sonnet5.5的綜合表現極為驚豔。在純前端 UI 動畫生成及日常編碼測試中,它展現出了超強的代碼直覺和自然的人機互動質感,其實測表現不僅全面超越了 OpenAI 近期發佈的 GPT-6Sol,甚至在部分高級編碼與智能體能力上直逼 OpenAI 的旗艦大杯 GPT-6Astra。

自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論
研究團隊專門挑選了極易引發模型幻覺的精細冷門問題進行測試,結果顯示,在無AI輔助的對照組中,參與者對36%至44%的問題選擇放棄作答;而在獲取AI建議後,這一不作答比例驟降至3%至6%。更為矛盾的是,在AI輔助下,參與者的答題自信心從29.

Claude Sonnet 5.5 偷跑:價格打穿地心,實測暴打 GPT-6 Sol、直逼 Astra
從昨晚起,X 平臺流傳其即將發佈的消息,多位開發者稱模型已進入發佈前最後階段,並在 Claude Code 中開啟灰度測試,或被路由至 5.5 版本"暗測"。專屬標識符已現,灰測用戶搶先體驗開發者爆料顯示,artifact 中已出現 Sonnet 5.