Arm發了個“挑模型神器”,針對硬件優化,能直觀對比延遲和內存佔用

2026年9月9日 07:27
站內 AI 整理稿

作者 | ZeR0 編輯 | 漠影 9月9日報道,今日,在Arm Create開發者大會上,Arm推出Arm AI Portal,提供針對Arm優化的模型、代碼、工作流和學習路徑,讓開發者與智能體都能便捷地在Arm計算平臺範圍內完成AI軟件的發現、優化及部署。無論是構建遊戲、普通應用、智能體還是其他AI系統,開發者都能從中獲得具體指導和可直接使用的開發資源。開發者可以查找面向特定任務的預優化模型,獲取性能與準確率數據,對比延遲、內存佔用和模型規模,並訪問代碼示例及部署工作流。這些數據能幫助開發者更快判斷應該使用哪一種模型及對應的模型表現。

首批預優化模型包括阿里巴巴通義千問、谷歌Gemma、Ultralytics YOLO,支持的runtimes涵蓋ExecuTorch、LiteRT、ONNX-RT。生態合作伙伴包括阿里巴巴、樹莓派及Ultralytics。經Arm優化的模型已實現顯著性能提升: 採用單線程執行與混合量化配置,搭載Q8_0 talker與code predictor組合方案,Qwen3-TTS在vivo X300手機上通過第二代Arm可伸縮矩陣擴展(SME2)的加速,實現了超過4倍的速度提升。

Ultralytics YOLO26在vivo X300手機上依託SME2技術,單線程FP16相較FP32實現超40%性能提升;在樹莓派5平臺依託NEON技術,採用FP16與INT8混合量化方案,相比FP32同樣實現超40%的性能提升。AI Portal現已正式上線。面向智能體AI的資源已開放預先體驗,正式版本將於後續推出。後續,Arm AI Portal計劃提供相關工具,支持開發者導入包括專有模型在內的自有模型,並在Arm平臺上開展性能分析與優化。Arm還在與火山引擎等合作伙伴合作,推動基於Arm AGI CPU的智能體沙箱。沙箱可以為智能體提供安全、隔離且能夠彈性擴展的執行環境。

Arm開發者關係副總裁Shantu Roy建議開發者在構建AI應用重點考慮4項決策: 為每項任務選擇合適的模型。根據延遲、隱私、規模和成本確定計算位置。把模型、工具、數據、狀態和運行時編排成完整系統。在真實目標設備和生產環境中驗證應用。只有將先進技術正確組合起來,並在真實目標設備上測試驗證其性能和用戶體驗,才能讓用戶真正感受到它們的價值。一、Arm AI Portal:各種預優化模型按需選,可對比延遲、內存佔用等數據 Shantu Roy談道,Arm長期參與中國技術生態的發展。中國企業和開發者正在快速推動AI從研究進入實際應用。

在模型領域,有阿里巴巴通義千問等模型;在雲計算領域,有阿里雲、火山引擎等雲平臺;在終端設備領域,vivo、OPPO等廠商正在推進端側AI;在物理AI領域,中國的機器人產業飛速發展。這些市場看起來截然不同,但開發者面對的底層問題高度一致:如何選擇模型,如何決定計算任務的部署位置,如何把不同的軟件和硬件組合成系統,以及如何驗證產品在真實設備上的表現?Arm能夠做的,是把這些能力組織在一套共同平臺之上,降低開發者採用技術和構建應用的摩擦。

Arm AI Portal覆蓋雲AI、邊緣AI和物理AI領域的Arm計算平臺,可幫助開發者快速定位適配目標場景的優化模型,提高開發速度,縮短尋找模型、測試性能和研究硬件特性的時間。該平臺將SVE、SME及神經網絡加速能力等Arm技術,與優化軟件生態連接起來,把針對Arm優化的模型、軟件工具、性能數據、示例代碼和部署工作流集中在一起。以第二代移動終端計算子系統(Arm CSS for Mobile 2)為例,其模型可藉助SME2和集成神經加速器的GPU實現加速,並可通過AI Portal獲得支持。

面向基於Arm架構的計算平臺,Arm AI Portal支持語言、語音、視覺及神經圖形等多類AI工作負載,可提供針對特定Arm硬件完成優化的模型,並給出相應的性能和精度信息。無論是機器人視覺模型、智能手機端的生成式AI,還是運行於雲CPU的任務專屬大語言模型,開發者均可通過該平臺獲取。Arm模型、工具及技術資源,也需要能夠被智能體理解和調用。Arm AI Portal適配開發者與智能體的現有開發環境,經Arm優化的模型可通過Hugging Face獲取,Portal相關資源則可通過模型上下文協議(MCP)供編程智能體訪問,使智能體瞭解應該怎樣使用Arm特定技術。

無論開發者使用哪種IDE或者編程智能體,都能在現有工作流程中訪問Arm的模型、工具和優化知識。應用構建完成之後,開發者還需要了解它在真實運行環境中的性能表現。Arm Performix是一個性能分析工具包,可在應用運行時採集性能數據,識別代碼熱點以及CPU、緩存、內存帶寬和資源利用率等方面的瓶頸。它相當於為開發者提供一個觀察應用運行狀態的窗口,幫助開發者找到性能損失發生在哪裡,並確定應該優先優化哪些部分。Performix能接入自動化和智能體開發流程,讓AI編程助手直接讀取性能分析結果,並結合代碼提出優化建議。

二、只有軟件足夠成熟,硬件才能真正發揮價值 開發者使用一項硬件技術時,高度依賴其背後的軟件、工具、框架和社區支持。過去15年,Arm持續參與軟件生態建設。Arm積極向超過1800個開源項目貢獻代碼,並與約12萬家合作伙伴共同建設軟硬件生態。一個成熟的平臺,往往會讓底層軟件變得近乎“不可見”。開發者不必時刻意識到它的存在,就能順利使用相關能力。Arm對開源項目和上游社區的投入,可減少企業維護軟件分支以及從頭重複開發的工作。Shantu Roy說,Arm的目標是讓開發者把更多時間用於應用創新,最終以儘可能短的路徑,把源代碼轉化為真正運行在生產環境中的工作負載。

昨日,在Arm Everywhere China大會上,Arm發佈多項新成果。在邊緣和移動計算方面,Arm發佈了CSS for Mobile 2,其中包括新的C2 CPU集群,以及集成專用神經網絡加速器的Mali G2-Ultra NX GPU。這意味著,開發者不僅可以在邊緣設備上運行AI,也可以把AI用於圖形渲染,在設備端實現AI原生圖形體驗。在雲計算方面,Arm發佈了新一代Neoverse CSS N4,並披露Arm AGI CPU生態合作新進展。這些產品為雲基礎設施提供了更高的能效和計算密度,用於應對越來越多樣化的智能體AI工作負載。

在物理AI方面,Arm把全面設計生態項目(Total Design)生態擴展到物理AI領域,並聯合生態夥伴發展機器人能力框架,希望構建一套共同語言,讓行業能夠更清楚地描述機器人的能力、行為、輸出以及系統要求。這些技術並非彼此獨立,它們共同構成了一套貫穿雲端、邊緣設備和物理世界的計算平臺。開發者可以在這套平臺上構建跨越不同計算位置的完整應用。對於開發者來說,這套共同平臺意味著可以讓AI更接近用戶。面對要求低延遲和隱私保護的應用,開發者可以利用SME2以及GPU端的神經網絡加速能力,在設備上運行部分AI任務,減少數據傳輸,改善響應速度,並保留用戶的私有上下文。

進入物理AI領域後,開發者需將雲端推理能力與真實設備連接起來。機器人、攝像頭和各種智能設備,需要同時利用本地計算、邊緣節點和雲計算。在雲端,開發者則需要高效運行和優化大規模智能體工作負載。Arm Performix等工具可以識別應用的性能熱點,幫助開發者提升雲端工作負載的速度和效率。因此,Shantu Roy認為,不應該把雲端、邊緣和物理AI理解成三個彼此分離的領域。它們是一條計算連續體。一個應用可以同時利用雲邊端的能力,並共享底層架構、軟件生態、性能優化方法和開發文檔。

以手機上的個人助手為例,為了保護隱私,用戶的個人上下文可以保留在設備上,語音、圖像等交互也可以優先在本地處理,以降低延遲;當任務需要更復雜的推理時,應用可將部分工作轉移到雲端的大型推理模型。所以,一項硬件能力只有在軟件足夠成熟、開發者能方便使用時,才真正具有價值。三、構建系統需要4類核心決策:從模型選擇到生產驗證 我們正在從以模型為中心的世界,轉向以智能體系統為中心的世界。一套真正用於生產環境的AI系統,通常同時包含模型、記憶、工具、數據訪問、隱私與安全機制、運行時環境等多個組成部分。在智能體應用中,系統屬性更加明顯,因為很多決策需要由智能體在運行過程中動態完成。

因此,開發者最終交付的不是一個孤立的模型,而是一套作為完整應用運行的系統。構建這類系統時,開發者通常需要處理4類核心決策:模型選擇、計算位置、系統集成與編排、生產驗證。1、模型選擇 模型選擇不應該被簡化成“小模型和大模型誰更好”。更合理的做法,是先確定需要完成的任務,再分析任務需要哪些能力,以及運行環境有哪些限制。開發者需要判斷:這項任務是否應該使用小模型?是否需要高度專業化的模型?是否需要把多個模型組合在一起?真實應用通常會同時使用多個模型。開發者應該先分解任務,再為每一項任務選擇合適的模型。

例如,“總結手機上的一條通知”和“分析六份文件並提出戰略建議”,是兩種完全不同的任務,前者可以由端側小模型快速完成,後者可能需要更大的推理模型、更長的上下文和更多計算資源。如果模型需要運行在手機等設備上,還必須考慮內存、功耗和散熱等限制。模型選擇必須與目標設備和用戶體驗一起考慮。2、計算位置 明確需要完成什麼任務之後,下一個問題是:這些工作應該在哪裡運行?關鍵問題不是“選擇本地還是雲端”,而是每種計算位置能夠為應用帶來什麼價值,以及怎樣把這些能力組合。AI應用通常會同時使用多種計算資源。硬件能力決定一項任務能夠在哪裡運行,而產品架構決定它應該在哪裡運行。這兩者需要結合起來。

設備端更適合運行要求立即響應、極低延遲、隱私保護、訪問本地數據的任務,邊緣端更適合運行需要在同一場所協調多臺設備的任務,雲端更適合承載需要彈性擴展、大模型或大規模計算資源的任務。一項應用把工作拆分到多個位置,是正常且常見的系統架構。對於一支機器人集群,與安全和環境感知直接相關的任務需在機器人本體上完成,多臺機器人之間的協調可以放在邊緣節點執行,訓練、長期學習以及整個機器人集群的優化則可以放在雲端完成。一臺配備視覺語言模型的攝像頭,可以在本地完成運動檢測和初步識別;攝像頭隨後可以把警報、通知或者需要進一步分析的任務上傳到雲端。通過這種分工,開發者能同時獲得本地響應速度和雲端算力。

3、系統集成與編排 在一款智能體應用中,開發者需選擇模型和推理方式,但應用能否正常工作,還取決於運行時能否協調工具、技能和數據,並持續維護狀態。模型、工具、數據、狀態和運行時之間的編排,會直接影響應用怎樣運行,也會決定用戶最終獲得怎樣的體驗。以遊戲為例,一款AI原生遊戲可能同時包含生成式圖形、玩家狀態和遊戲邏輯。這些組件需要由同一套運行系統進行協調。4、生產驗證 最後一個問題是:這套應用能否在真實產品上正常運行?開發者需要證明,在筆記本電腦或者模擬環境中構建的應用,能夠在目標設備和目標系統上達到預期效果。筆記本電腦上的原型不是最終產品。

應用進入生產環境之前,必須在目標設備上進行測試,並根據設備返回的實際數據反覆測量、分析和優化。在移動設備上,一個模型單獨測試時可能表現很好,但進入手機之後,它會受到內存容量、散熱和電池續航的限制。因此,只在原型環境中測試是不夠的,開發者必須把模型放到目標手機上運行。在雲端,開發者可以通過批處理模擬雲工作負載,但真實雲流量通常具有併發、突發和持續變化等特徵,只在簡化的模擬負載下得到的結果,不一定能夠反映應用進入真實雲環境後的表現。在玩遊戲時,一款遊戲可能在30秒測試窗口內保持每秒60幀,但如果設備升溫之後出現降頻,幀率就可能下降。這意味著系統可以完成短期演示,卻未必具備可持續運行能力。

因此,單個基準測試只能說明單個組件理論上能夠做什麼,生產環境測試才能說明整套系統是否真正有效。結語:長期投入跨端軟件優化,幫開發者改善最終用戶體驗 Shantu Roy總結說,Arm平臺的基礎能力包括三個方面: 1、開發者可針對Arm架構進行優化,部署範圍可從雲端延伸到邊緣設備。2、強調每瓦性能。無論端側還是雲端,AI工作負載都受到散熱、能耗和經濟成本的約束,因此性能不能脫離功耗和系統成本單獨討論。3、擁有超過2200萬名開發者。龐大的開發者和合作夥伴生態,可以推動更多軟件、模型和工具在整個平臺上得到優化。該公司長期投入底層軟件優化,目的始終是幫助開發者更快構建應用。

一套系統可能使用了最好的模型、運行時和硬件,但只要存在嚴重延遲、網絡異常、模型錯誤或者不穩定行為,最終用戶體驗就會受到影響。Arm希望建立一層貫穿整個計算平臺的軟件與優化能力,使開發者在平臺一端獲得的性能優化和開發經驗,可以隨著應用延伸到其他Arm平臺。

Related

相關文章

IT之家模型更新

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同

作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

2 小時前
IT之家模型更新

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關

作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。

4 小時前
量子位模型更新

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型

鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

8 小時前

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率

此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。

8 小時前