不止一顆CPU?智能體經濟時代,Arm對算力平臺有了新理解
導語:200瓦功耗之差的新戰場記者:郭思編輯:包永剛9月9號,人社部公佈了第八批新職業名單,尤為矚目的一個新職位是智能體開發員。崗位的正式確立,意味著相關技術已走向主流,而背後則是底層技術的實質性躍遷,當模型不再停留在問答層面,而是開始具備“行動”能力——底層算力的需求結構也在重塑。智能體在運行過程中,需要頻繁地獲取數據、調用工具並等待結果返回,這對系統的響應延遲提出了極高的敏感度。因此,以往“唯算力論”的粗放型資源配置模式,已逐漸失去經濟性與合理性。正是在這一技術範式轉移的關鍵節點,產業界給出了最直接的回應。
就在職業名單公佈的前一天(9月8日),Arm在Arm Everywhere China年度大會上展示了Arm AGI CPU 在中國生態的最新進展,發佈了Neoverse CSS N4。精準呼應了智能體時代對高效推理算力的迫切需求,更預示著底層硬件架構正加速向適應AI Agent複雜交互的方向演進。兩條路徑,一個底座 在首款自研芯片上直接冠以“AGI”之名,足見Arm對AGI CPU這款處理器的自信。在今年三月正式發佈時,Arm AGI CPU的核心性能就備受關注,136個Arm Neoverse V3核心、96條PCIe Gen6通道、12通道DDR5內存。
而更常被人問起的一個問題則是,客戶為什麼要選擇Arm AGI CPU?在Arm Everywhere China年度大會上,Arm雲AI業務拓展副總裁Eddie Ramirez直接通過一個數據給出了答案:同等性能下x86方案的TDP通常是500瓦,AGI CPU只有300瓦。這200瓦的功耗差距,並非僅僅是參數表上的數字優化,而是精準擊中了當前數據中心基礎設施的痛點。如今,數據中心最稀缺的資源早已不是芯片本身,而是電力供應和機架空間。將這200瓦的差距攤到機架級別,意味著在同等功耗限制下,能夠部署的計算核心數幾乎可以實現翻倍,這筆成本帳也讓客戶的遷移成為了一件順理成章的事情。
IDC 報告顯示,基於 Arm 架構的機架級服務器市場規模已經超越 x86,成為加速計算領域的主流平臺。當Arm親自下場推出自研芯片,市場存在的另一大疑慮則在於:這是否會與購買Arm IP進行自研設計的客戶形成競爭?對此,Arm給出的答案相當務實。推出Arm AGI CPU,本質是響應客戶的真實需求。Arm 舉例,像 SAP 這類客戶,在雲端業務會採用基於 Arm 架構的 Graviton 實例,但本地私有云環境仍大量部署第三方芯片。同一家企業,雲端用 Arm 架構、本地採用另一套架構,造成了計算環境割裂。
Arm 從 SAP 以及眾多客戶處收到的核心訴求,就是需要一套能夠貫通雲端到本地、體驗一致的計算平臺,Arm AGI CPU 正是為此打造。這類本地場景此前並非 Arm 的覆蓋範圍,從這個意義上理解Arm AGI CPU ,更多的是Arm對市場空間的外延拓展,而非搶奪現有云服務客戶的存量市場。事實上,今年 3 月 Arm AGI CPU 發佈之際,亞馬遜雲科技、Google、微軟、NVIDIA、甲骨文等超大規模雲廠商均表態支持。這些巨頭早就依託 Arm 架構收穫可觀的能效紅利,也更希望推動更多軟件完成 Arm 生態適配。
而當我們把目光看向Arm此次發佈的Neoverse CSS N4時,我們會驚奇的發現,Arm在智能體時代,不止提供IP,升級點也從單個性能指標拓展到系統級升級。官方介紹,Neoverse CSS N4是Arm迄今可配置程度最高的CSS平臺,單裸片能從8核配到128核,最高頻率3.8GHz。在2026年,單純比拼核心數量已經不算什麼新鮮事了。競爭對手早已推出了核心數更多的產品。所以,CSS N4 真正的殺手鐧,並不在於堆疊了多少個核心,而在於它極大地提升了數據搬運的速度和效率。它有兩個值得一提的設計,一是支持最新一代 LPDDR6 內存。
相比於目前主流的 DDR5 內存,LPDDR6 不僅更省電、佔用芯片面積更小,還能讓數據傳輸更順暢。當其他廠商還在使用上一代內存技術時,Arm 已經率先將新一代內存引入了數據中心。另一方面,他還支持最新的 PCIe Gen 7 接口標準。這個接口就像是芯片與外部設備之間的“高速公路”,Gen 7 的帶寬比目前主流產品領先了一代。這意味著數據進出處理器的速度會大幅提升。也就是說,當行業趨勢從更大的算力集群走向更快的數據搬運速度之時,Arm早已做好了系統準備,在核心數、內存和接口上同時實現跨代升級的組合,讓“數據搬運瓶頸”這個老大難問題變得可解決,可突破。
從商業角度,Arm的產品邏輯其實也非常簡單。無論客戶處於哪種階段,哪個規模,只要他還在做智能體行業,Arm就會為其提供選擇。頭部大廠有完整的芯片團隊,要的是IP授權或CSS。N系列、V系列的核心、互連、內存和I/O預集成好,客戶再加自己的加速器、內存拓撲和軟件棧。這條路的門檻是5億到8億美元的流片投入,以及從RTL到量產軟件棧的多年工程積累。AWS七年做了五代Graviton,微軟18個月迭代兩代Cobalt,背後都是這種投入。當然,市場上並非每一家客戶都需要打造定製芯片。對於希望部署量產就緒算力的客戶而言,Arm AGI CPU 也能提供 Neoverse 平臺具備的卓越性能與能效。
“一些此前從沒考慮過Arm的廠商,現在也開始關注這條路徑”。Eddie Ramirez在大會上直言。換句話說,無論客戶從哪個入口進來,最後用到的工具鏈和開發環境是同一套。Arm從IP授權擴展到CSS再到商用CPU,背後其實是同一件事——做人工智能時代的基石平臺。硅基共生時代,我們需要一個怎樣的開發平臺?“做人工智能時代的基石平臺”——聽起來十分宏大的概念,但落到具體的工程實踐中,除了非常出色的硬件性能表現外,其實還需要回答一個非常樸素的問題:在AI時代,開發者究竟需要什麼樣的支持?芯片是底座,但底座之上還有很長的路要走。
從模型選型到性能調優,從部署測試到上線運維,開發者需要工具、數據和參考實現。如果這些環節各自分散在不同的倉庫、文檔和論壇裡,即便芯片性能再強,開發效率也會被拖慢。這正是 Arm 試圖補齊的環節。Arm Create 開發者大會上海站上,Arm 正式宣佈,Arm AI Portal 正式上線,定位是為開發者提供一個統一入口,在 Arm 計算平臺上完成 AI 軟件的發現、優化和部署。從功能上看,它做的事情並不複雜:開發者可以在上面查找針對特定任務預優化的模型,獲取性能和準確率數據,對比延遲、內存佔用和模型規模,還能找到代碼示例和部署工作流。聽起來像是一個模型市場加文檔中心的組合。
但它的特殊之處在於,所有工作都圍繞 Arm 架構做了優化,並且考慮到了智能體時代的開發模式變化。值得一提的是,Arm AI Portal 並未強行嵌入開發者的工作流,而是選擇適配現有開發環境。這種“不改變用戶習慣”的設計思路雖然在業內並不罕見,卻也存在著較大難度,模型版本迭代頻繁,性能數據需要持續更新,不同硬件平臺的優化參數也需要分別維護。
Arm 的做法是先把基礎打好——平臺目前支持語言、語音、視覺及神經圖形等多類 AI 工作負載,首批預優化模型包括阿里巴巴通義千問、Google Gemma 以及 Ultralytics YOLO,支持的運行框架涵蓋 ExecuTorch、LiteRT 和 ONNX-RT。生態合作伙伴包括阿里巴巴、樹莓派和 Ultralytics。圖:開發者可藉助 Arm AI Portal,基於性能數據評估模型在特定 Arm 平臺上的適配情況從而為模型選型與部署決策提供參考。
另一個亮點是,Arm 優化後的模型可以直接在 Hugging Face 獲取,而 Portal 的資源則通過模型上下文協議(MCP)開放給編程智能體。MCP 相當於給機器定了一套通用語言,不再需要人類開發者在中間做翻譯或搬運。這意味著,隨著開發工作流逐漸由智能體驅動,平臺資源可以被它們自動發現和調用,省去了額外的適配成本。這個設計選擇的背後,觸及了一個更深層的行業趨勢:我們正在進入一個“硅碳共生”的時代,AI 應用的開發不再僅僅是人類開發者的專屬工作,AI 模型和智能體正在成為開發流程中的協作者,甚至是獨立的生產者。當開發工作日益向智能體驅動演進時,機器與機器之間的關係變得至關重要。
儘可能的將繁瑣及複雜留給AI ,而將決策和創意留給人類,這便是Arm給出的對“碳硅共生”的理解。在性能優化方面,Arm 提供了一些可量化的數據。例如,採用單線程執行與混合量化配置,搭載 Q8_0 talker 與 code predictor 組合方案,Qwen3-TTS 在 vivo X300 上通過第二代 Arm 可伸縮矩陣擴展(SME2)的加速,實現了超過 4 倍的速度提升。
Ultralytics YOLO26 在 vivo X300 上依託 SME2 技術,單線程 FP16 相較 FP32 實現超 40% 性能提升;在樹莓派 5 平臺上,採用 FP16 與 INT8 混合量化方案,相比 FP32 同樣實現超 40% 的性能提升。這些數據當然不能代表所有場景下的表現,但至少說明了一個方向:在 Arm 架構上,通過軟硬件協同優化,仍然可以在特定工作負載上獲得有意義的性能收益。對於開發團隊而言,這意味著他們不需要從零開始做模型調優,可以直接從已經優化過的起點出發,把精力集中在應用邏輯上。不用重複造輪子,Arm給了開發者一個看上去最簡單卻也是最本質的開發平臺選擇。
而當我們把視線從芯片和架構中抽離,重新審視“智能體開發者”這個新職業時,我們會發現,當每一次技術奇點來臨時,人類都會需要重塑對於人與工具之間的關係。而當硅基共生來臨時,智能體開發者一方面代表著一個新的產業或者說技術範式的崛起,而另一方面也代表著,官方對於一種全新生產關係的認證。在這場變革中,Arm正在鋪設通往下一代 AI 的關鍵路徑。從AGI CPU對能效邊界的靜默突破,到Neoverse CSS N4對數據流轉的系統級疏通,再到Arm AI Portal借MCP協議為機器間搭起通用語言——應時而動,應需而生。它無意成為一方霸主,只願做智能體、開發者與智能體經濟背後,那片生生不息的底層土壤。
Related
相關文章

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同
作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

MiniMax Code CLI 正式開源,在評測中取得 76.7% 的任務通過率
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 Domado 的線索投遞!9 月 18 日消息,MiniMax 今晚宣佈,MiniMax Code CLI 的 v0.4.12 版本面向全球開發者正式開放,並且以 MIT 協議正式開放源代碼。

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關
作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。
PrismML Releases Ternary Bonsai 2 27B: A 5.9 GB Apache 2.0 Model Retaining 98.2% of Qwen3.8 27B Performance
PrismML has released Ternary Bonsai 2 27B, a ternary-weight version of Qwen3.8 27B. The language model occupies 5.93 GB, against 53.80 GB in FP16. PrismML reports that it keeps 98.2% of the parent model’s average across 20 benchmarks.

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型
鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率
此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。